linuxsir首页 LinuxSir.Org | Linux、BSD、Solaris、Unix | 开源传万世,因有我参与欢迎您!
网站首页 | 设为首页 | 加入收藏
您所在的位置:主页 > Linux基础建设 >

Masakhane开源项目希望借助机器翻译和AI改变非洲

时间:2019-12-03  来源:未知  作者:admin666

据外媒VentureBeat报道,在非洲大陆的部分地区可以找到英语、阿拉伯语和法语方言,这些方言在部落、族裔群体和国界中使用,但它们并非非洲本土方言。一些语言学家估计非洲大陆上存在的语言种类为2000种或更多。这可能会阻碍通信和商业发展。今年年初,这种担忧导致建立了Masakhane开源项目,非洲技术人员正在努力使用神经机器翻译来翻译非洲语言。

Screen-Shot-2019-11-11-at-11.08.02-AM.png

Kathleen Siminyu是肯尼亚卢希亚部落的成员。尽管学校和全国各地都说英语,但部落说不同的语言,这在Siminyu和她的邻居之间造成了语言障碍。为了使社区团结在一起,她于今年早些时候加入Masakhane,积累了作为内罗毕机器学习和数据科学女性分会的联合组织者以及AI for Development协调员的经验。

Siminyu认为,使用机器学习翻译语言可能是非洲AI用例增长的关键,并使非洲人能够将AI应用到造福非洲人的生活中。Siminyu表示,诸如Masakhane之类的项目对于连接非洲的开发人员和研究人员社区以及建立框架以建立持续的长期合作至关重要。

她说道:“目前,我正在思考研究网络如何在这个大陆上运作。” “我认为语言是一种障碍,如果消除这种障碍,语言将使许多非洲人能够参与数字经济,并最终参与人工智能经济。我觉得……将非数字时代的人们带入AI时代是我们的责任。”

Masakhane项目与非洲的AI研究人员和数据科学家合作,该组织旨在创建连接非洲众多人口的神经机器翻译。该项目是由来自南非的Jade Abbott和Laura Martinus创建的,并在Indaba深度学习和Sauti Yetu NLP Unconference上进行了演讲和交谈之后聚集在一起。“ i.Masakhane”的名称在isiZulu中意为“我们共同建设”。

Masakhane与无国界译者等组织以及学者合作,以查找语言数据集。除了将非洲本地语言翻译成英语外,该项目还将寻求翻译方言,例如尼日利亚的Pidgin English或非洲北部和中部的阿拉伯语。

创建针对非洲语言的机器翻译后,该小组设想了一系列使非洲人受益的开源项目的潜力。该小组目前有来自整个非洲大陆的约60名贡献者,但在南非、肯尼亚和尼日利亚最为活跃。项目要求每个参与者以各自的母语帮助收集数据或训练模型。

Masakhane并不是唯一一个为非洲提供的更多机器翻译的雄心勃勃的计划。本周,Mozilla和德国政府部门启动了一个  开源项目,以收集来自非洲当地语言的语音数据。

本月初,Siminyu与人工智能促进发展合作,与数据科学挑战网站Zindi一起发起了非洲语言数据集挑战赛。除了Siminyu和Abbott,评估数据集的顾问还来自Google AI和Facebook AI Research。挑战参与者制作的数据集将来可能会用于训练Masakhane的神经模型。

根据GitHub的2019年Octoverse报告,当肯尼亚和尼日利亚等国家成为全球开源项目增长最快的贡献者团体之时,项目开始大批涌现。最近几周,非洲技术和开发人员生态系统的增长吸引了Twitter CEO Jack Dorsey和GitHub CEO Nat Friedman等硅谷高管访问了尼日利亚的拉各斯等非洲部分地区。

Masakhane的志愿者在一次集体采访中告诉VentureBeat,机器翻译对非洲的好处是巨大的。受访者来自非洲大陆的各个角落-突尼斯、尼日利亚,南非和刚果民主共和国-他们表示希望将非洲纳入全球AI地图,并找到解决非洲问题的办法。

“我们可以解决我们的问题。我们拥有专业知识、智慧、知识,我们只需要对此承担一些责任。”专注于尼日利亚约鲁巴岛的研究人员Olabiyi Samuel说。广泛可用且准确的非洲语言机器翻译可以使更多的非洲声音在线上进入全球对话,或快速将教育材料从英语翻译成非洲语言。多项研究发现,当人们以母语接受教学时,他们会学得更好。Siminyu和其他项目参与者希望Masakhane成为一系列研究项目的起点,这些研究项目可以将AI应用于非洲挑战并改善对该大陆重要的其他部门的生活。

“我们应该考虑农业以及我们如何解决粮食问题。我们应该考虑气候变化、我们应该考虑医疗保健……我认为语言是切入点。” 但是Siminyu也承认面临的挑战,她表示说:“是的,我认为路很长。”

Espoir Murhabazi居住在刚果民主共和国,主要研究班图语Lingaga。他想更好地理解班图语,以及机器学习如何从包含共同词根的单词中推断出含义。班图语是一种凝集性语言,意味着单词可以包含词干含义和多个元素来构成每个单词。这是解决Masakhane所面临的语言之间的结构差异所面临的一系列技术挑战的示例。

在一个更有趣的层面上,Murhabazi希望看到像Masakhane这样的项目能够将歌曲翻译成英语,从而使每个喜欢音乐的人都能理解歌词。他说道:“上一次我在肯尼亚时,发现人们在{敏感词}和酒吧里随着音乐跳舞,却听不懂意思。”

Masakhane的工作将分阶段进行,首先是使用政府文件或报纸等公开可用的数据将英语翻译成非洲语言。完成后,该小组计划为翻译创建单独的基准模型。然后,他们将作品提交给世界各地的NLP顶级会议。

Abbott表示,该项目现在处于数据收集和翻译阶段,因为与构成现代互联网主干的欧洲语言不同,非洲语言缺乏基准和大型数据集。Masakhane项目的参与者除了创造数字经济并允许人们用自己的语言学习之外,还希望非洲人成功创建AI项目。

许多AI研究会议在欧洲,亚洲或北美举行,尽管行业和国家对AI人才的全球需求很大,但政府有时甚至拒绝非洲人进入该领域,即使他们正在西方国家学习。例如,当加拿大温哥华准备迎接全球最大的AI研究会议NeurIPS时,下个月,包括Masakhane志愿者在内的非洲和亚洲研究人员报告说,加拿大政府拒绝了签证。

对于Abbott 和Martinus来说,前往非洲以外地区活动的能力(例如NeurIPS)已带来了好处,这些好处可以直接应用于蓬勃发展的Masakhane项目。Abbott 表示,在此类事件中,其他NLP开发人员在尝试优化模型性能时会分享100多个技巧,观点和经验教训。

Abbott认为:“与在全球范围内使用低资源语言工作的社区的聚会确实激发了我们的研究兴趣。”例如,在推出后不久,Masakhane 从“ Jehovah’s Witness”的文本中查看了380种语言的 JW300数据集,这是该小组参加ACL后获得的见解。

“我们正在研究的数据集范围是…20000个句子,这在机器翻译世界中很小。她表示:“这个JW300数据集中的同一语言以100万个并行句子结束,这是一个巨大的进步。”

雄心勃勃的Masakhane项目仍处于初期阶段,正在寻找志愿者,目前正在收集数千种语言的数据。像MySQL,Python和TensorFlow这样的开源项目为现代互联网和机器学习等学科的发展奠定了基础。

如今,来自欧洲、亚洲和北美等地的开发人员仍然在开源项目贡献方面居世界领先地位,但是,如果Masakhane及其类似项目取得成功,这可能会非洲大陆和世界其他地区带来重大变化。

友情链接
  • Mozilla发布Firefox 67.0.4,修复沙箱逃逸漏洞
  • 蚂蚁金服正式成为CNCF云原生计算基金会黄金会员
  • Firefox 68将采用Microsoft BITS安装更新
  • OpenSSH增加对存储在RAM中的私钥的保护
  • 谷歌想实现自己的curl,为什么?
  • Raspberry Pi 4发布:更快的CPU、更大的内存
  • Firefox的UA将移除CPU架构信息
  • Ubuntu放弃支持32位应用程序实属乌龙,Steam会否重回Ubuntu怀抱
  • Qt 5.13稳定版发布:引入glTF 2.0、改进Wayland以及支持Lottie动
  • 红帽企业Linux 7现已内置Redis 5最新版
  • Slack进入微软内部禁用服务清单,GitHub也在其列?
  • 安全的全新编程语言V发布首个可用版本
  • Windows Terminal已上架,快尝鲜
  • 阿里巴巴微服务开源生态报告No.1
  • 面世两年,Google地球将支持所有基于Chromium的浏览器
  • 推进企业容器化持续创新,Rancher ECIC千人盛典完美收官
  • CentOS 8.0最新构建状态公布,或于数周后发布
  • Debian移植RISC
  • 微软拆分操作系统的计划初现雏形
  • Oracle发布基于VS Code的开发者工具,轻松使用Oracle数据库
  • Ubuntu 19.10停止支持32位的x86架构
  • 微软为Windows Terminal推出全新logo
  • 联想ThinkPad P系列笔记本预装Ubuntu系统
  • 微软发布适用于Win7/8的Microsoft Edge预览版
  • 启智平台发布联邦学习开源数据协作项目OpenI纵横
  • 经过六个多月的延迟,微软终于推出Hyper
  • ZFS On Linux 0.8.1 发布,Python可移植性工作
  • DragonFly BSD 5.6.0 发布,HAMMER2状态良好
  • Linux Kernel 5.2
  • CentOS 8.0 看起来还需要几周的时间
  • 百度网盘Linux版正式发布
  • PCIe 6.0宣布:带宽翻倍 狂飙至256GB/s
  • PHP 7.4 Alpha 发布,FFI扩展,预加载Opcache以获得更好的性能
  • Canonical将在未来的Ubuntu版本中放弃对32位架构的支持
  • Scala 2.13 发布,改进的编译器性能
  • 微软的GitHub收购了Pull Panda,并且使所有订阅完全免费
  • Windows Subsystem for Linux 2 (WSL 2)现在适用于Windows 10用
  • Debian 10 “Buster”的RISC
  • MariaDB宣布发布MariaDB Enterprise Server 10.4
  • DXVK 1.2.2 发布,带来微小的CPU开销优化
  • DragonFlyBSD 5.6 RC1 发布,VM优化,默认为HAMMER2
  • PrimeNG 8.0.0 发布,支持Angular 8,FocusTrap等
  • GIMP 2.10.12 发布,一些有用的改进
  • 清华大学Anaconda 镜像服务即将恢复
  • Debian GNU/Linux 10 “Buster” 操作系统将于2019年7月6日发布
  • 时时彩论坛
  • 五星体育斯诺克
  • 北单比分直播
  • 河北11选5走势图
  • 福建体彩36选7开奖结果
  • 九龙图库下载