现在的 AI 竞赛,搞到有价值的数据很重要。一个残酷的现实是:训练 AI,其实最需要的是一个“好爹”。
Reddit 上有研究者揭露了一个非常有意思的现象:
面对同一个问题,谷歌的 Gemini 回答会更倾向于给你推 YouTube 视频里的教程和解释,而 ChatGPT 和 Claude 却只会老老实实给你找纯文本答案。
是因为 Gemini 的多模态算法遥遥领先吗? 不,仅仅是因为谷歌拥有 YouTube。
对于 Gemini 而言,它可以近乎零成本地白嫖全球最大的视频语料库、字幕和底层元数据。
所谓的模型偏好,本质上是由母公司的“祖传资产”决定的。
同样的剧本,在国内也一模一样。
字节的 seedance 模型在动态运镜和网感上惊艳众人,大家也都猜测拿到了抖音的内容。
靠着自家数千亿条爆款短视频语料的日常投喂,这种独家的数据壁垒,是别的初创团队拿钱都砸不出来的。
我们总以为 AI 是在绝对客观地学习整个世界,但现实是,它的认知往往受限于它“爹”建好的围墙花园。
小编在日常使用中,也确实感觉各路模型的能力处理日常事务拉不开太大差距了,
那么比拼“家底”、掌握独家的数据池,将是某个 AI 在自己的独特领域被人选用的重要理由。
点击图片查看原图