中国国家数据局计划在2028年前把中国建成所谓“数据强国”,并向发展中国家提供数据集,配合低成本中国AI模型向海外扩张。上海人工智能实验室推出的“万卷”多语言数据集,更明确要求内容符合所谓“中国主流价值观”。
北京早期发现,ChatGPT曾把姚明误认成“中国女性”、混淆《西游记》和《红楼梦》,而英文训练数据在台湾、人权等问题上也不接受中共那套叙事,于是开始争夺AI训练数据的话语权。不过中国内部数据仍严重割裂,不少实验室还得从境外模型“蒸馏”数据。《自然》刊登的研究发现,中共官媒叙事已经进入美国主流AI模型的训练数据。中共想输出的从来不只是模型,而是经过审查和党国价值观筛选的信息体系;自由世界不能再把训练数据当成没有政治后果的普通原料。
点击图片查看原图