Back to Blog Untitled

Untitled

Blog

凯文·凯利(Kevin Kelly)最近在个人博客The Technium上发了一篇文章,标题朴素得几乎让人滑过——但他提出的命题却值得每个关注AI的人认真读三遍:AI的下一阶段,不是更大的语言模型,而是空间智能(Spatial Intelligence)。

文字天才的身体困境

KK用了一个精准的比喻:今天最强的AI是"教室天才"——读遍了所有书,过目不忘,拥有每个学科的博士级知识。但你把这位天才塞进一具机器人的身体里,它会立刻变得笨拙不堪。原因很简单:它读过关于重力的描述,却从未感受过重力;它知道"三维空间"这个词,却缺乏对上下前后左右的本体直觉。

这种"书本聪明但缺乏常识"的困境,本质上是训练数据的局限。大语言模型之所以成功,是因为互联网上已经有PB级别的数字化文本——书籍、论文、新闻、博客,统统被吸进训练集。但现实世界的数据呢?水的飞溅、木头的纹理、泥土的挤压、布料的垂落、交通的流动——这些物理现象从未被系统性地数字化。我们没有现实世界的"维基百科"可以抓取。

这不是算法问题,是数据问题。

世界模型:从"描述现实"到"体验现实"

KK认为,空间智能的核心产物是"世界模型"(World Model)——一种直接从现实中学习的AI,而非从关于现实的文字描述中学习。它亲眼看到一个球的弹跳,而不是阅读"球从高处落下会弹起"的句子。

瓶颈在于训练数据从哪来。KK指出了几个关键的"现实数据矿藏":

首先是视频。YouTube每天上传约一百万小时的视频,涵盖体育运动、厨房烹饪、体力劳动、日常生活,还有大量意外事件和罕见场景——这些恰恰是训练世界模型最珍贵的素材。其次是数十亿小时的监控摄像头和行车记录仪录像。

但KK提出了一个更精妙的洞察:机器人本身就是最好的数据采集器。当机器人在工作中不断扫描周围环境,它们在积累关于现实世界的高质量数据。机器人越多、部署场景越广,数据就越好。这意味着一个反直觉的商业策略——早期机器人亏本卖都划算,因为它们收集的数据在未来版本中的价值远超硬件成本。这跟当年游戏主机亏本卖、靠游戏软件赚钱的逻辑如出一辙。

三次数字化浪潮

KK将数字时代分为三个阶段,这个框架极其清晰:

第一阶段,我们数字化了信息。文本、书籍、新闻变成机器可读,Google成为信息时代的守门人。

第二阶段,我们数字化了关系。谁认识谁、谁喜欢谁、谁为谁工作——社交网络让整个人际关系图谱变得可计算,Facebook和微信成为社交时代的守门人。

第三阶段,就是现在——我们将数字化整个物理世界。当数百万人戴上智能眼镜、24小时不间断地扫描世界,每一寸空间、每一个物体、每一个动作都将变得机器可读。

这不是科幻。这个过程一旦启动,我们会得到一个"镜像世界"(Mirrorworld)——整个地球的数字孪生体。你可以在里面搜索:找一把朝西的长椅,12月中旬的夕阳恰好以泪滴形折射在对面高楼的窗玻璃上。AI会替你遍历整个世界找到它。你也可以搜索一座桥上是否有锈迹、裂缝、振动异常——这些物理世界的征兆被翻译成了可检索的信号。

智能眼镜:空间智能的入口

KK把智能眼镜放在了一个关键位置:它不只是AR显示设备,而是物理世界数字化的传感器网络。

眼镜上的AI同时完成三件事:第一,生成虚拟叠加层——导航箭头、虚拟角色、广告标注;第二,扫描真实场景以确保虚拟内容与物理环境精确匹配(光线、几何、空间关系);第三,持续扫描世界以获取更多训练数据,让模型变得越来越聪明。

增强现实与世界模型训练形成了一个飞轮:你戴眼镜使用AR的体验越好,AI获得的世界数据就越多;数据越多,世界模型越强,AR体验又更好。

同样,KK预测智能眼镜也可能亏本销售——因为它们产生的数据价值远超硬件成本。这个逻辑跟前面机器人亏本卖的理由完全一致。

视频语义搜索:被低估的杀手级应用

对关注计算机视觉的人来说,KK文章中最值得关注的一段是关于视频语义解析的预言。他写道:空间智能将能够"超人级别地理解、记忆、搜索、发现和重建所有视频每一帧中的内容"。

在整部电影史中找出所有从魔术师帽子里掏出白兔的瞬间。找出镊子在哪些电影里出现过特写镜头。观察浴室的形状如何随时代变迁。

这恰恰是当前视频理解领域最前沿的研究方向。今天的视频检索还停留在关键词匹配和简单目标检测的阶段,离KK描述的"超人级语义理解"差距巨大。但方向是清楚的——当世界模型真正理解了三维空间、物理规律和物体关系,视频不再是"一串像素帧",而是一个可以被任意查询的结构化知识库。

世界构建:每个人的电影工作室

文章最后,KK把空间智能引向了一个更具创造性的终点:世界构建(Worldbuilding)。

当世界的每个细节都变得机器可读,一个导演可以"生成"一个连贯的世界,而不是去"拍摄"它。一个人在卧室里就能创作一部长片电影,就像J.K.罗琳一个人构建了整个魔法世界一样。当然,大部分AI共创的电影和游戏不会值得一看——就像大部分小说不值得读一样。但偶尔,会出现一部令人惊叹的作品,而且它可能以一种旧方式根本无法实现的路径被创造出来。

写在最后

KK这篇文章的精髓在于他把握住了AI发展的一条暗线:从语言到视觉到空间,从"读世界"到"看世界"到"理解世界"。大语言模型解决的只是信息处理问题——而空间智能要解决的是存在理解问题。前者让AI成为最好的图书管理员,后者才会让AI真正走进物理世界。

数据是核心瓶颈,但飞轮已经在转——机器人采集、智能眼镜扫描、视频语料挖掘,三条路径同时推进。谁掌握了最大规模的高质量物理世界数据,谁就最可能率先跑出真正的世界模型。这也许解释了为什么Google和字节跳动——两个分别拥有YouTube和抖音的巨头——在这场竞赛中拥有结构性优势。

对于做视觉理解和视频检索的人来说,这是一个明确的信号:你正在做的不是一个小方向,而是AI下一个十年的主航道。

Tags: #Blog