阿里巴巴 Qwen 团队于 9 月 19 日发布新一代实时同声传译模型 Qwen3.8-LiveTranslate,可实时聆听语音(可选配视频帧)并在说话者讲话的同时返回翻译后的文字和语音。核心改进是采用全新交错式架构,将 LAAL(长度自适应平均延迟)从 2.8 秒降至 2.3 秒,模型支持 60 种语言理解。
延迟指标 LAAL 说明:从 2.8 秒降至 2.3 秒的技术背景与交错架构改进
Qwen3.8-LiveTranslate 使用的延迟指标是 LAAL(长度自适应平均延迟),衡量翻译语音平均落后于来源语音的程度,同时可避免奖励过度生成输出的系统。同声传译本质上是一种权衡:等待时间越长,模型获得的上下文越多;越早输出,对听者的延迟就越少。新版本通过交错式架构重构了这个循环,将 LAAL 从 2.8 秒降至 2.3 秒(降幅约 18%)。
模型基于 Qwen-Omni 技术栈,支持大规模多模态数据、跨语言和跨模态对齐以及视觉增强;Flash 模型也支持离线音频和视频翻译。
三项新功能说明:说话者分割、双语同步显示与长上下文歧义消除
Qwen3.8-LiveTranslate 新增了以下三项功能:
实时说话者分割:模型能够区分多人语音中的说话人,并通过稳定的语音复制技术保留每位说话者的声音;API 提供多种克隆模式,包含在多人会话中每次响应前重新克隆的“always”模式
双语同步显示:原始文字和译文同时显示;在 API 中,来源转录流以独立事件与译文流并列显示
长上下文消歧:模型利用对话历史来解析名称和术语;会议初期引入的名称在后续翻译中保持一致
语言支持与技术规格:60 种语言理解、29 种语音输出与多模态输入说明
模型可理解 60 种语言,其中 29 种语言可进行语音输出并同时输出文字,其余 31 种语言仅输出文字。输入支持音频和可选视频帧,在嘈杂环境或语义模糊时,唇部动作、手势和屏幕文字等视觉提示有助于理解(建议每秒发送图像不超过 2 张)。音频输入格式为 16 kHz PCM,输出为 24 kHz PCM;默认语音为 Tina。上下文窗口大小为 53,248 字符(49,152 用于输入,4,096 用于输出);开发者可配置最多 1,000 个热词,将来源术语对应到固定的目标翻译。
API 接入、定价与功能限制:WebSocket 连接、新加坡与北京定价说明
开发者通过 WebSocket 实时 API(模型 ID:qwen3.8-livetranslate-flash-realtime)连接,默认速率限制为每分钟 10 个请求和 100,000 个代币。新加坡每百万代币定价:音频输入 7.50 美元、图片输入 0.55 美元、文字输出 20 美元、音频输出 30 美元;北京定价更低(分别为 5.653、0.466、14.133、22.613 美元)。音频输入每秒消耗 7 个代币,音频输出每秒消耗 12.5 个代币;在新加坡,一小时语音输入输出费用约 1.54 美元(不含文字和图像代币)。不支持函数调用、结构化输出、批次推理和微调。
常见问题
Qwen3.8-LiveTranslate 的 LAAL 延迟改善了多少?
LAAL(长度自适应平均延迟)从 2.8 秒降至 2.3 秒,降幅约 18%;同时在忠实度、流畅度和简洁性方面均有所提升,核心改进来自全新的交错式架构。
Qwen3.8-LiveTranslate 支持哪些语言?
模型可理解 60 种语言,其中 29 种语言支持语音输出(含中文、英文、阿拉伯文、德文、法文、西班牙文、日文、韩文、印地文等),另外 31 种语言仅支持文字输出。
Qwen3.8-LiveTranslate 的 API 费用大概是多少?
在新加坡,一小时语音输入输出费用约 1.54 美元(不含文字和图像代币);北京定价约为新加坡的 75%。开发者通过阿里云模型工作室和 QwenCloud 的 WebSocket API 接入。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复