想象一下,你站在异国街头,看着一块看不懂的路牌,随口问一句“这是什么意思”,耳机里立刻传来AI的翻译。这不是科幻电影——华盛顿大学的研究团队真的把摄像头塞进了耳机里。他们改造了索尼WF-1000XM3,在两侧耳机各嵌入一颗米粒大小的黑白摄像头,配合视觉语言模型,让耳机能“看见”你注视的方向,并实时回答你的问题。在演示中,用户看着厨房,AI一秒内描述出“有窗户、水槽和几瓶调料”;看着披头士专辑封面,它准确报出“Abbey Road”。不过,这还只是原型机,离量产还有距离。
目前能确认到哪一步
announced:华盛顿大学团队在CHI '26会议上发布原型机,基于索尼WF-1000XM3改装,尚未有量产计划或价格信息。
米粒摄像头如何塞进耳机?
传统耳机体积小巧,但内部空间极其有限。华盛顿大学团队却成功在索尼WF-1000XM3的腔体内,各嵌入一颗米粒大小的黑白摄像头。这些摄像头功耗极低,不到5毫瓦,仅在需要时激活,以节省电量。由于摄像头位于耳朵两侧,视角会被头部遮挡?团队利用立体视觉原理——就像人眼通过两个瞳孔合成图像一样,AI将左右摄像头画面融合,形成完整的视野。
原型机外观比普通耳机大一圈,接近20年前的拇指蓝牙耳机。但团队表示,随着微型化技术发展,未来版本可以更紧凑。当前摄像头仅支持低分辨率黑白成像,无法识别颜色,但足以完成物体识别、文字翻译等任务。电池续航方面,连续视频流仍不可行,但静态图像问答场景下表现稳定。
实测表现:83%准确率,但仍有局限
在17项视觉问答测试中,90名用户参与评估,VueBuds的响应质量与Ray-Ban Meta眼镜相当。物体识别和翻译准确率达83%,识别书籍标题和作者时更高达93%。演示中,用户看着厨房,AI一秒内描述出“有窗户、水槽和几瓶调料”;看着披头士专辑封面,它准确报出“Abbey Road”。这些结果来自研究团队的论文,尚未经第三方独立验证。
不过,当前版本存在明显短板:黑白摄像头无法回答颜色相关问题;高分辨率导航和实时翻译需要更强大的硬件;电池无法支撑长时间视频流。此外,研究团队也承认,在嘈杂环境或快速移动时,识别准确率会下降。这些限制意味着VueBuds短期内还无法取代智能手机或专用辅助设备。
隐私争议:会重蹈Google Glass覆辙吗?
Google Glass因隐私问题被公众抵制,用户甚至被称为“Glasshole”。VueBuds的设计试图规避这一点:摄像头仅拍摄低分辨率黑白静态图像,且通过本地处理而非云端,减少数据泄露风险。耳机上有一个小型指示灯提示摄像头开启,但研究团队承认,这种提示很容易被忽略——被拍摄者可能根本不知道耳机正在“看”他们。
更令人担忧的是,耳机同时具备麦克风和蓝牙连接,理论上可以同步采集音频和图像。虽然当前原型机仅用于视觉问答,但一旦量产,滥用风险不可忽视。研究团队在论文中提到了隐私保护措施,但未提供具体技术细节。在公众对隐私高度敏感的今天,VueBuds能否避免成为新一代“间谍设备”,仍是未知数。
资料线索
• newatlas.com
本文是基于公开页面整理的 AI 硬件情报,不是本站实测或购买建议。图片发布副本增加 waoo.ai 水印,原摄影者和来源标识保留。



交流讨论
最新评论