您当前的位置 :实况网-重新发现生活>资讯频道 > 聚焦 > 正文
展会噪音破85分贝,翻译设备集体"翻车":讯飞AI眼镜用"看谁译谁"给出答案
2026-09-22 15:47:01 来源:今日热点网

85分贝是什么概念?是展会现场人声、音响、洽谈声交织的日常。对传统翻译设备而言,这样的环境几乎等于"死亡测试场"——手机App、翻译耳机、手持翻译机在安静会议室尚能应付,一旦置身嘈杂现场,多声源混杂、人声互相干扰,错译、漏译、乱译接踵而至。翻译大模型早已足够成熟,但"听不清",就谈不上"译得准"。在"百镜大战"的2026年,谁能先解决嘈杂环境下的拾音难题,谁就能真正赢得出海商务人群。

讯飞AI眼镜,以5颗气导麦克风+1颗骨传导麦克风组成5+1麦克风阵列,创新落地唇动识别多模态降噪技术,实现"看谁译谁"的独特体验,把视觉感知融入拾音降噪链路,从源头破解嘈杂环境收音难题,让翻译从"听得见"进阶到"译得准"。

5+1麦克风阵列:构筑硬件拾音底座

整机仅重约40g,在轻量化机身内布局5颗气导麦克风与1颗骨传导麦克风,构建六通道麦克风阵列。5颗气导麦克风分布于镜腿,依托波束成形算法区分远近声源、抑制侧后方杂音,增强目标方向人声,完成环境声音全景采集;1颗骨传导麦克风不依赖空气传声,通过振动拾取发声信号,过滤大量空气传播的背景噪音,弥补气导麦克风在强噪声下的信号缺损。

传统翻译工具(手持翻译机、翻译耳机)仅靠气导麦克风做声学降噪,当多人同时说话,多个有效人声混杂,单纯音频算法难以锁定翻译目标,极易把旁人对话纳入识别——这正是展会翻车的核心根源。5+1阵列完成了声音维度的多层过滤,但讯飞并未止步,而是给AI"加上眼睛"。

唇动识别多模态降噪:复刻"鸡尾酒会效应"

人类身处喧闹酒会,能盯着对话对象、观察其唇部神态,过滤周遭嘈杂听懂眼前人发言,这就是"鸡尾酒会效应"。讯飞AI眼镜通过软硬自研,将这套感知机制移植到穿戴设备上。

眼镜搭载1200万109°广角前置摄像头,实时捕捉视野内人物唇部运动。系统一边接收多路音频流,一边解析唇部动态画面,将"声音信号"与"视觉特征"融合计算:当画面中某人嘴唇产生说话动作,系统即判定其为沟通目标,定向增强该方位音频,优先解析其语音并投射译文。视线看向谁,就拾取谁的声音——看谁译谁。唇动信号在此扮演"目标锁定锚点",即便噪声严重干扰音频,只要捕捉到唇部动作即可锁定声源,显著降低识别错误。

落到真实场景:展台上多名客商交谈,目光看向海外客户,镜片实时呈现其发言译文;视线转向另一人,翻译源无缝切换,无需转动设备、手动切模式,跟随自然视线完成翻译切换,跨语言沟通回归人与人的平视对话。这套多模态降噪能力深度服务旁听同传、面对面翻译、线上同传、通话翻译四大体系,122种语种(包含方言及口音)互译在展会、酒会、跨境洽谈等复杂场景全程生效。

对比传统方案与竞品:全栈自研构筑壁垒

这套方案并非现成组件拼接,而是全栈自研成果:从麦克风阵列硬件布局、端侧图像处理、唇动特征提取,到多模态融合模型、语音识别、翻译大模型,全链路自主研发迭代。硬件层面约40g机身内容纳多麦克风、摄像模组、显示与电池;算法层面解决端侧算力约束,兼顾效果与功耗;上层对接讯飞星火翻译大模型,叠加17+1行业专业术语库,兼顾通用与商务专业场景精度。

权威评测印证了这套技术体系。IDC《中国AI翻译技术评估》中,科大讯飞在翻译速度、翻译效果、翻译专业度、翻译拟人度、产品应用成熟度、商业化规模、研发投入、用户推荐度8大维度全部登顶,拿下6项满分,充分证明其在技术、产品落地的综合领先。

翻译设备的能力分两层:算法决定"译得准不准",信号获取决定"听不听得清"。过去行业把大部分精力押在算法上,却忽视了前置的信号问题。讯飞AI眼镜用5+1麦克风阵列叠加唇动识别多模态降噪,回答了"嘈杂环境怎么听清"这一行业难题——把实验室技术转化为展会、酒会等真实场景可感知的沟通体验。从"看谁译谁"到"看谁译准",AI翻译终于走出了安静房间。

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。

关键词:

相关阅读
分享到:
版权和免责申明

凡注有"实况网-重新发现生活"或电头为"实况网-重新发现生活"的稿件,均为实况网-重新发现生活独家版权所有,未经许可不得转载或镜像;授权转载必须注明来源为"实况网-重新发现生活",并保留"实况网-重新发现生活"的电头。