盖茨基金会正在召集一个由60家人工智能实验室、企业、慈善组织及其他机构组成的联盟,为目前系统中代表性不足的社区扩大可用语言数据。该计划希望通过协调许多伙伴此前各自开展的工作,在五年内覆盖逾30亿人。
比尔·盖茨认为,增加国际援助并明智使用AI,可以加快减少不平等的进展。他同时表示,开发者未能把正确的人类价值观嵌入技术,也没有让道德准则控制AI,把务实乐观与治理警告结合起来。
该项目启动前一年,全球34个最富裕国家中有26个削减了对贫穷国家的发展援助。联合国可持续发展目标的进展仍缓慢且不均衡,因此联盟的技术承诺无法脱离资金与机构能力。
基金会此前已承诺投入10亿美元,支持AI在健康、教育及小农服务方面的工作。在年度Goalkeepers活动上,基金会展示教师识别学习差距、农民发现虫害及卫生人员检索患者资料的案例,但这些例子尚不能证明联盟目标规模上的成效。
语言质量至关重要,因为误译可能造成实际后果。一个例子显示,马拉维孕妇表达“羊水破了”时,系统可能直译成“把水扔掉了”,说明模型缺少本地语言与文化背景时存在的风险。
Mozilla Data Collective强调,互联网数据并不具有代表性,社区应能按照自己的条件贡献文化与语言数据集。Google的Project Vaani正与本地伙伴合作,在印度每个地区收集超过15万小时语音,以捕捉同一种语言内部的方言差异。
Anthropic、Google与OpenAI Foundation均为参与者。Anthropic承认其产品在许多非洲语言上落后,而联盟治理仍在制定中。一个秘书处预计将追踪各方承诺并识别缺口,但所有成员的具体义务尚未全部确定。
因此,覆盖30亿人是一项目标,并不是当前采用率。后续证据应包括数据同意与授权、方言覆盖、独立质量测试、经记录的本地收益,以及社区能否继续影响自身语言资源的使用方式。