人工智能正在从"单感官"走向"全感官"。继视觉-语言模型取得巨大成功后,研究者们正在将触觉、听觉和运动感知整合到统一的AI模型中,赋予机器人类人般的全面感知能力。

技术突破

OpenAI的GPT-5原生支持图像、视频、音频和文本的统一理解,能够"看懂"视频中的动作、"听懂"语音中的情感,并基于多感官信息进行综合推理。Google的Gemini Ultra更进一步,整合了机器人的触觉传感器数据,能够感知物体的硬度、温度和纹理。

机器人应用

全感知AI对机器人来说意义重大。斯坦福大学的研究团队训练了一个全感知机器人,它不仅能看懂面前的物体,还能通过触觉判断物体的重量和材质,从而调整抓取力度——就像人类伸手拿鸡蛋时会本能地减轻力度。这一突破使得机器人在家庭、医疗和精密制造中的应用前景大幅拓宽。

人类的智能不只是大脑的智能,更是身体和感官与世界互动的智能。全感知AI正在补上人工智能缺失的这一环。

产业展望

全感知AI模型将首先在服务机器人、智能座舱和AR/VR设备中得到应用。据IDC预测,2028年超过50%的新型智能设备将集成多模态AI能力。人工智能的终极目标——像人一样感知世界、理解世界、与世界互动——正在从科幻走向现实。