OpenAI 的 Astra 宣传片,翻出了一段 1979 年的 MIT 实验录像。
这个实验叫「Put That There」,来自 MIT 的 Architecture Machine Group,也就是后来 MIT Media Lab 的前身。实验完成并录制于 1979 年,相关论文在 1980 年的 SIGGRAPH 上正式发表。
录像里,一个人坐在巨大的投影屏幕前,手上戴着磁性传感器。他指着屏幕上的图形,对计算机说:
“把那个放到那里。”
系统会把语音里的“那个”“那里”,和手指指向的位置结合起来,移动指定物体。后来,它甚至可以在加勒比海地图上创建、复制和调度船只。
这台机器当然没有真正听懂人类。
它只能识别大约 100 个词,使用针对特定场景编写的固定语法,还依赖提前录入说话者的声音。
但真正超前的地方在于:研究人员没有只想着让语音识别更准确,而是让计算机结合语言、手势、屏幕内容和上下文来判断人的意图。
如果指令不清楚,机器还会主动追问:
“哪一个?”
“放在哪里?”
“相对于什么?”
这是人机交互史上最早的多模态实验之一。
它第一次清楚地展示了:人与计算机交流,不一定非要依靠键盘、鼠标和精确命令。语言、手势、画面和上下文,可以共同组成一句完整的指令。
近半个世纪后,OpenAI 用这段录像为 Astra 开场,不只是在致敬。