
9 月 30 日,哔哩哔哩 Index LLM 团队正式发布多语言翻译模型家族 Index-Translate。其 2B、9B 以及 35B-A3B(预览版)文本模型权重已在 Hugging Face 与 ModelScope 平台开放,面向开发者提供下载与使用。
Index-Translate 是基于 Qwen3.5 构建的多语言翻译模型家族,文本模型覆盖包括中文、英文在内的 150 种语言,并支持术语、格式、保留内容等翻译指令。团队还将共同的多语基础扩展到语音翻译、音节可控翻译以及长文档翻译等方向。
一个家族,四种能力
Index-Translate 并非单一模型,而是一组面向不同场景的翻译模型:
– Index-Translate:负责翻译文本、结构化内容与社区表达,是家族的基础文本翻译模型。
– Index-Echo:可生成目标语言的字幕或配音,在生成配音时会参考源语音的说话人声音特征。
– Index-Homura:能够根据用户指定的目标音节数调整译文,使翻译结果在节奏和长度上更贴合需求。
– Index-NativeLong:支持输入完整文档,利用上下文维持前后文联系,适合长文翻译。
看懂社区”黑话”的翻译
官方展示的案例凸显了这类模型对社区语境的理解能力。例如一句游戏社区常用表达”狒瘾犯了就去打”,其真实含义是”想玩《最终幻想 XIV》的劲头又上来了”。Index-Translate-9B 将其译为英文”当最终幻想的瘾头上来了,就去玩”;2B 版本译为”想玩最终幻想时就去玩”;作为对比,另一款翻译模型则误译为”如果你得了猴子瘾,去打架”,未能理解”狒”在此处是”最终幻想”的谐音梗。
在音节可控方面,针对”生活两天,是一种什么体验”这一句,Index-Homura-9B 在设定三个不同目标长度时给出了不同措辞:目标与实测均为 10 个音节时给出较短译文;14 个音节时扩展为带语气词的完整问句;18 个音节时则进一步补充了”勉强度日”的语境。这种按音节数调控的能力,对歌词、诗歌、配音台词等讲究韵律的场景尤为有用。
长文档翻译的一致性挑战
长文翻译中,人名前后不一致是常见难题。在一段约 32K tokens 的奇幻文本中,”王妃”是一个人物姓名。官方对比显示,同一 9B 模型采用相邻上下文及自动词表的分块翻译时,同一人名在不同位置被译成了多个不同写法,甚至出现语义偏差;而 Index-NativeLong-9B 采用原生全文翻译,则能保持人物称谓的一致性。
这说明,对于小说、剧本、长篇报告等长文本,借助上下文进行整体翻译,能显著提升专有名词与人物称谓的前后统一。
已开放体验与代码
目前,Index-Translate 已提供公开演示页面,用户可在线体验文本翻译功能;模型代码与权重也已托管至 GitHub 与 Hugging Face,方便开发者本地部署与二次开发。ModelScope 平台同样上线了相关模型,其中包括 35B-A3B 版本。
对中文互联网社区而言,这类开源、支持多语言且能理解社区表达的翻译模型,有望在字幕生成、跨语言内容创作、长文档本地化等场景中发挥作用。随着多语基础向语音与长文档方向延伸,翻译模型的适用边界也在持续拓宽。







