您的当前位置:首页>资讯 > 正文

火山翻译上新38个稀有语种 自研训练模型效率提升超500%

  • 2021-12-31 13:16:21 来源:凤凰网科技

近期, 火山翻译官网上新了包括世界语、塔希提语、鞑靼语等在内的38个稀有语种的翻译。目前,包括汉语、英语、阿拉伯语、俄语、法语、西班牙语六个通用语种在内,火山翻译已具备94个语种、8742个语向的翻译能力,整体 bleu(机器翻译质量自动评估指标)达33.45,处于行业领先水平。

据了解,通过采用自研的 mRASP 多语言模型,火山翻译仅使用一个模型就完成了上述38个语种与英文的双向互译,突破了传统双语言翻译模型对每个语向单独训练、单独上线服务的方式,大幅降低机器学习的训练和服务成本。

“通常情况下,训练76个语向的双语言模型需要150-200天。而相同硬件条件下,训练一个多语言模型只需要30天。”火山翻译团队介绍,“对于请求量小的语种,使用 mRASP 模型集中服务可以大大节省计算资源,仅需半张用于深度学习训练的 Tesla T4 显卡就可以满足38个语言的全部翻译请求,和双语翻译所需的资源一样。”

图说:蓝色部分为火山翻译上新的38个语种

由于稀有语种缺少训练用的平行语料,翻译质量往往容易大打折扣。火山翻译通过  mRASP  中的对比学习和词对齐信息,可以很好地借助单语语料和其他拥有丰富语料的语种来帮助训练,弥补训练数据的不足。数据显示,火山翻译此次上新的稀有语种平均 bleu 值达33.36,其中,海地语翻译表现最为突出,bleu 值达50.76。

火山翻译由字节跳动 AI Lab 研发。2021年,火山翻译凭借“并行翻译”技术一举打破了“自回归式”技术在机器翻译领域的绝对统治地位,夺得国际机器翻译大赛(WMT)德语到英语方向机器翻译冠军;此前,火山翻译已在WMT中荣获7项冠军, 并斩获了平行语料过滤对齐项目的2项第一。

目前,火山翻译拥有火山同传、机器翻译与视频翻译三大产品,支持飞书、今日头条、西瓜视频等业务的翻译需求,并通过字节跳动旗下的企业级技术服务平台火山引擎对外提供翻译服务。

标签: 火山 语种 翻译 模型 机器翻译 语言 mrasp 语料 英语 wmt

推荐阅读

一口500亿活性菌 真能促消化?丨凰家实验室

喂,三点几嚟,喝口乳酸菌先啦。

俄媒:印度航天机构成功为其载人航天任务测试低温发动机

目前,仅有三个国家——美国、俄罗斯和中国拥有独立自主的载人航天能力。

现实版《钢铁侠》!山东首例人工心脏植入患者出院

他使用也是“中国造”人工心脏。

中小学生脊柱侧弯人数已超500万,这些不良习惯速改

中小学生脊柱侧弯人数已超500万,这些不良习惯速改

刚刚通报!这里发现1例阳性

刚刚通报!这里发现1例阳性

猜您喜欢

【版权及免责声明】凡注明"转载来源"的作品,均转载自其它媒体,转载目的在于传递更多的信息,并不代表本网赞同其观点和对其真实性负责。亚洲科技网倡导尊重与保护知识产权,如发现本站文章存在内容、版权或其它问题,烦请联系。 联系方式:8 86 239 5@qq.com,我们将及时沟通与处理。

业界