新消息丨图灵奖得主萨顿警告:AI行业过度依赖合成数据是一个大错误

IT之家 2026-08-19 15:24:24

IT之家 8 月 19 日消息,里奇 · 萨顿(Rich Sutton)是当今人工智能热潮背后关键技术的先驱之一,但如今,他认为科技巨头为了让 AI 持续发展而采取的路线存在严重问题。


(资料图片仅供参考)

这位加拿大计算机科学家、图灵奖得主在当地时间周二发布的红杉资本播客节目中表示,AI 行业越来越依赖合成训练数据,这可能正在把整个行业带向错误的方向。

当被问及使用合成数据是否能够帮助大型语言模型持续扩展时,萨顿直言:“这绝对是个大错误。也许这会成为下一条重要的经验教训。”

所谓合成数据,是指由算法或 AI 模型人工生成的信息,而不是从真实世界的原始数据中采集而来。随着 AI 公司不断搜寻互联网以及其他新的训练数据来源,合成数据的吸引力也越来越高。例如,自动驾驶训练可以使用计算机生成的汽车图像,AI 欺诈检测系统则可以使用虚构的银行交易记录。

某种程度上,科技巨头也认同萨顿的观点。

各大科技公司正在不惜一切代价寻找更多真实数据。OpenAI 此前公开寻找大规模、专有的数据集,希望获得那些无法轻易从互联网上获取的数据,用于训练 AI 模型。本周早些时候,谷歌同意支付 1,000 万美元(IT之家注:现汇率约合 6,756.9 万元人民币),收购已经破产的 Spirit Airlines 内部数据和软件,这也凸显出专有真实数据对于 AI 训练的价值正在不断提升。

萨顿在周二的播客中表示,人工制造的数据并不能充分替代真实数据。

他以人类行为为例进行了说明。“我们不可能为其他人的思想制造合成数据。”他说。

萨顿更倾向于使用真实的体验数据,也就是 AI 智能体通过与真实环境互动、观察实际发生的事情,并不断从行动结果中学习所获得的信息。

“你无法通过合成数据预测无人机在现实物理世界中会如何与环境互动。”萨顿说。他还指出,机器人的电机中存在摩擦和磨损等变量。“这个世界无比复杂,任何对它的模拟都不过是管中窥豹。”

如今,这一理念已经成为一家初创公司的发展方向。

上个月,萨顿与他的前学生 Khurram Javed 共同创办了 Oak Lab。这家初创公司正在开发能够持续从自身经历中学习的 AI 智能体,而不是主要依赖规模庞大、提前整理好的数据集。

目前,Oak Lab 尚未公布融资轮次或投资者信息。

标签: 算法 图灵奖 唐·萨顿 人工智能模型

返回顶部