9月20日消息,阿里千问于19日推出同声传译大模型 Qwen3.8-LiveTranslate。该模型借助 Interleave 架构对实时同传进行重构,在准确度、流畅度和简洁度方面均有提升,字均延迟(LAAL)由 2.8 秒缩短至 2.3 秒。

官方指出,在覆盖 60 种语言的前提下,Qwen3.8-LiveTranslate 增加了三项能力,使其同传功能可以更广泛地应用于真实场景:
实时说话人分离,每句话的归属清晰可辨,音色复刻更加稳定;
原文与译文同帧输出,双语同屏呈现;
长上下文消歧,结合前文理解当前内容,使人名和术语的翻译更为精准。
Qwen3.8-LiveTranslate 采用基于 Hybrid MoE 的 Thinker–Talker 双模块设计,以 Interleave 方式将流式理解、文本输出与语音生成衔接起来。其中,Thinker 将视频、音频、原文与译文编排进同一条因果序列,按时序交替排列并端到端产出,使理解与翻译在单一序列内完成;Talker 则结合译文和源音频,将译文合成为保留原说话人音色的译文语音。
在覆盖 14 个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,Qwen3.8-LiveTranslate 在翻译忠实度、流畅度、简洁度以及说话人识别错误率 DER(Diarization Error Rate,说话人分离错误率)四个维度上,均优于当前行业主流的实时同传系统。
官方在公开 FLEURS 音频测试集上对 70 个语言方向的实时同传表现进行了评测。Qwen3.8-LiveTranslate 在翻译质量、字均延迟、语音识别准确率以及语音合成质量四个维度上,领先于上一代及当前主流的实时同传系统。





















