机器人导航通常需要激光雷达、多摄像头阵列等昂贵传感器,但法国AI公司Mistral AI刚刚发布的新模型Robostral Navigate,号称仅凭一个普通RGB摄像头和自然语言指令就能完成导航任务。这个8B参数的模型在R2R-CE基准测试中,未知环境成功率76.6%,比此前最佳单摄像头方案高出近10个百分点,甚至超过了部分多摄像头和深度传感器系统。Mistral表示,该模型完全自研,训练数据全部来自模拟环境,包含约40万条轨迹和6000个场景。不过,目前它仍是“迈向统一具身智能体的第一步”,纯视觉方案在真实安全关键场景中的表现还有待验证。
目前能确认到哪一步
announced:Mistral AI官方宣布发布Robostral Navigate,但尚未提供实际部署或商用时间表。模型目前仅基于模拟环境训练,真实世界表现未知。
单摄像头导航:省钱但够用吗?
大多数机器人导航系统依赖激光雷达、深度传感器或多摄像头阵列来感知环境,这些硬件不仅昂贵,还增加了集成复杂度。Mistral AI新发布的Robostral Navigate模型试图打破这一惯例——它只用一个RGB摄像头和用户的语音指令,就能让机器人在室内外环境中找到目标位置。据Mistral官方博客,该模型在未知环境中的成功率达到76.6%,比此前最佳单摄像头方案高9.7个百分点,甚至比最好的多摄像头/深度传感器系统还高出4.5个百分点。在已知环境中,成功率进一步提升至79.4%。
不过,这些数据全部来自模拟环境测试。Mistral承认,纯视觉方案在真实世界、安全关键场景中仍需验证。例如,光照变化、遮挡或动态障碍物都可能影响单摄像头的判断。目前,Robostral Navigate被定位为“迈向统一具身智能体的第一步”,距离实际商用还有距离。但若其表现能在真实环境中复现,将大幅降低机器人导航的硬件门槛。
Pointing技术:让机器人学会“指路”
Robostral Navigate的核心是一种名为Pointing的技术。当机器人接收到语音指令后,模型会预测目标位置在当前摄像头画面中的坐标,以及到达时的理想朝向。如果目标不在视野内,模型会切换到局部坐标调整模式,例如“向前2米,向左1.5米,左转25度”。Mistral表示,这种Pointing方法使模型对摄像头参数变化等干扰更鲁棒,无需依赖深度信息。
模型基于Mistral自研的视觉语言模型构建,专门擅长物体定位和计数等接地任务。训练数据全部来自模拟环境,包含约40万条轨迹和6000个场景。Mistral还采用了一种基于前缀缓存的训练方法,将所需token数量减少了22倍,训练时间从数月缩短至数天。之后,他们使用在线强化学习算法CISPO进一步优化,据称将成功率提升了3.2个百分点。
从语言模型到机器人:Mistral的野心
Robostral Navigate被设计为适用于轮式、足式和飞行机器人,应用场景包括制造、配送和物流。如果纯视觉方案可行,企业将无需为机器人配备昂贵的激光雷达,从而降低硬件成本和集成难度。Mistral表示,该模型完全自研,并非基于现有开源视觉语言模型,这显示出其在机器人AI领域的长期投入。
值得注意的是,Mistral正在扩大其机器人团队,并明确表示Robostral Navigate只是“迈向统一具身智能体的第一步”。此前,该公司还发布了专注于数学证明的Leanstral 1.5模型。从语言模型到机器人导航,Mistral正在快速拓展AI能力边界。不过,Robostral Navigate目前仍处于发布阶段,真实环境中的表现和商用时间表尚未公布。
资料线索
• heise.de
本文是基于公开页面整理的 AI 硬件情报,不是本站实测或购买建议。图片发布副本增加 waoo.ai 水印,原摄影者和来源标识保留。


交流讨论
最新评论