linuxsir首页 LinuxSir.Org | Linux、BSD、Solaris、Unix | 开源传万世,因有我参与欢迎您!
网站首页 | 设为首页 | 加入收藏
您所在的位置:主页 > 小企鹅新闻图书馆 >

Google AI工程师介绍Translatotron,一种端到端的直接语音翻译模

时间:2019-05-19  来源:未知  作者:admin666

就在两天前,Google AI的研究团队推出了Translatotron,一种端到端的直接语音翻译模型。在他们的研究论文 Direct speech-to-speech translation with a sequence-to-sequence model 中他们Translatotron认识到该模型在两个西班牙语到英语数据集上实现了高翻译质量。

Google AI工程师介绍Translatotron,一种端到端的直接语音翻译模型

语音转换系统通常分为三个独立的组件:

自动语音识别:用于将源语音转录为文本。 机器翻译:用于将转录的文本翻译成目标语言 文本到语音合成(TTS):用于从翻译文本生成目标语言的语音。

将任务划分为此类系统已成功运作,并为许多商业语音转语音翻译产品提供动力,包括谷歌翻译。

2016年,大多数工程师和研究人员意识到,当研究人员使用单个序列到序列模型进行语音到文本翻译时,对语音翻译的端到端模型的需求。

2017年,Google AI团队证明此类端到端模型的性能优于级联模型。最近,已经提出了许多用于改进端到端语音到文本翻译模型的方法。

Translatotron证明单个序列到序列模型可以直接将语音从一种语言翻译成另一种语言。此外,它不依赖于任何一种语言的中间文本表示,如级联系统所要求的那样。它基于序列到序列网络,它将源光谱图作为输入,然后生成目标语言中翻译内容的光谱图。

Translatotron还使用了两个经过单独训练的组件:一个将输出频谱转换为时域波形的神经声码器和一个扬声器编码器,用于在合成的翻译语音中保持源扬声器的声音。

序列到序列模型使用多任务目标来预测源和目标转录本,并在训练期间生成目标谱图。但在推理期间,没有使用没有成绩单或其他中间文本表示。

Google AI的工程师通过测量BLEU(双语评估替补)评分来验证Translatotron的翻译质量,该评分是通过语音识别系统转录的文本计算的。

结果确实落后于传统的级联系统,但工程师已经设法证明了端到端直接语音到语音转换的可行性。

Translatotron通过结合扬声器编码器网络,可以在翻译的语音中保留原始扬声器的声音特征。这使得翻译的语音听起来自然而且不那么刺耳。根据Google AI团队的说法,Translatotron提供了比基线级联模型更准确的翻译,同时保留了原始扬声器的声音特征。

工程师得出结论,Translatotron是第一个端到端模型,可以直接将一种语言的语音翻译成另一种语言的语音,并可以在翻译的语音中保留源语音的声音。

要了解有关此新闻的更多信息,请查看Google AI的博文。

论文PDF版可以到Linux公社资源站下载:

------------------------------------------分割线------------------------------------------

免费下载地址在 http://linux.linuxidc.com/

用户名与密码都是www.linuxidc.com

具体下载目录在 /2019年资料/5月/18日/Google AI工程师介绍Translatotron/

下载方法见 http://www.linuxidc.com/Linux/2013-07/87684.htm

------------------------------------------分割线------------------------------------------

Linux公社的RSS地址:https://www.linuxidc.com/rssFeed.aspx

本文永久更新链接地址:https://www.linuxidc.com/Linux/2019-05/158728.htm

linux Racket 7.3 发布,改进了Racket-on-Chez,重构的IO系统等等 思科报告Nexus 9000数据中心交换机,PI软件和EPN管理器中的严重漏洞
友情链接
  • Mozilla发布Firefox 67.0.4,修复沙箱逃逸漏洞
  • 蚂蚁金服正式成为CNCF云原生计算基金会黄金会员
  • Firefox 68将采用Microsoft BITS安装更新
  • OpenSSH增加对存储在RAM中的私钥的保护
  • 谷歌想实现自己的curl,为什么?
  • Raspberry Pi 4发布:更快的CPU、更大的内存
  • Firefox的UA将移除CPU架构信息
  • Ubuntu放弃支持32位应用程序实属乌龙,Steam会否重回Ubuntu怀抱
  • Qt 5.13稳定版发布:引入glTF 2.0、改进Wayland以及支持Lottie动
  • 红帽企业Linux 7现已内置Redis 5最新版
  • Slack进入微软内部禁用服务清单,GitHub也在其列?
  • 安全的全新编程语言V发布首个可用版本
  • Windows Terminal已上架,快尝鲜
  • 阿里巴巴微服务开源生态报告No.1
  • 面世两年,Google地球将支持所有基于Chromium的浏览器
  • 推进企业容器化持续创新,Rancher ECIC千人盛典完美收官
  • CentOS 8.0最新构建状态公布,或于数周后发布
  • Debian移植RISC
  • 微软拆分操作系统的计划初现雏形
  • Oracle发布基于VS Code的开发者工具,轻松使用Oracle数据库
  • Ubuntu 19.10停止支持32位的x86架构
  • 微软为Windows Terminal推出全新logo
  • 联想ThinkPad P系列笔记本预装Ubuntu系统
  • 微软发布适用于Win7/8的Microsoft Edge预览版
  • 启智平台发布联邦学习开源数据协作项目OpenI纵横
  • 经过六个多月的延迟,微软终于推出Hyper
  • ZFS On Linux 0.8.1 发布,Python可移植性工作
  • DragonFly BSD 5.6.0 发布,HAMMER2状态良好
  • Linux Kernel 5.2
  • CentOS 8.0 看起来还需要几周的时间
  • 百度网盘Linux版正式发布
  • PCIe 6.0宣布:带宽翻倍 狂飙至256GB/s
  • PHP 7.4 Alpha 发布,FFI扩展,预加载Opcache以获得更好的性能
  • Canonical将在未来的Ubuntu版本中放弃对32位架构的支持
  • Scala 2.13 发布,改进的编译器性能
  • 微软的GitHub收购了Pull Panda,并且使所有订阅完全免费
  • Windows Subsystem for Linux 2 (WSL 2)现在适用于Windows 10用
  • Debian 10 “Buster”的RISC
  • MariaDB宣布发布MariaDB Enterprise Server 10.4
  • DXVK 1.2.2 发布,带来微小的CPU开销优化
  • DragonFlyBSD 5.6 RC1 发布,VM优化,默认为HAMMER2
  • PrimeNG 8.0.0 发布,支持Angular 8,FocusTrap等
  • GIMP 2.10.12 发布,一些有用的改进
  • 清华大学Anaconda 镜像服务即将恢复
  • Debian GNU/Linux 10 “Buster” 操作系统将于2019年7月6日发布
  • 时时彩论坛
  • 五星体育斯诺克
  • 北单比分直播
  • 河北11选5走势图
  • 福建体彩36选7开奖结果
  • 九龙图库下载