训练中加入一条真实数据就可能阻止AI“胡言乱语”
创始人
2026-05-17 09:42:42
0

科技日报北京5月15日电 (记者张佳欣)当AI不断用自己生成的数据“喂养”自己,它就可能逐渐失去准确性,最终输出越来越多错误信息,甚至“胡言乱语”。英国伦敦国王学院领导的研究团队发现,只需在训练过程中加入哪怕一条来自真实世界的数据,就可能有效阻止这种被称为“模型崩塌”的现象。相关成果发表于新一期《物理评论快报》。

“模型崩塌”这一概念于2024年提出,指的是AI模型如果长期依赖自身生成的数据进行训练,模型性能会不断退化,最终输出失真内容。随着高质量人类文本数据逐渐接近枯竭,越来越多AI系统开始使用合成数据训练,这让模型崩塌风险进一步上升。

此次,团队通过分析一类被称为“指数族”的统计模型发现,在封闭循环训练(模型完全依赖自身生成数据学习)中,模型崩塌几乎不可避免。

研究显示,解决方法异常简单:只需在训练过程中加入一条来自外部世界的真实数据,哪怕其数量远远少于AI生成数据,也足以阻止模型性能持续退化,这种作用即使在机器生成数据数量无限增加时依然有效。

过去关于模型崩塌的研究多集中在大语言模型等复杂系统,由于其内部机制难以解释,错误来源也难以追踪,这也成为AI产生“幻觉”的原因之一。通过研究更简单的统计模型,科学家能够从数学上解释为何少量真实数据就能打破模型崩塌,从而为未来更复杂AI系统提供设计原则。

类似现象也存在于另一类名为“受限玻尔兹曼机”的机器学习模型中,表明这一规律可能具有更广泛适用性。下一步,他们计划将这一理论扩展到神经网络等更复杂的系统,以验证其在大语言模型中的实际效果。

相关内容

热门资讯

企业如何智能化转型?“5A框架... 人民网廊坊8月12日电 (记者李君强、张腾扬)2026数智经济论坛8月12日在河北廊坊市举行。论坛上...
别让智能眼镜沦为“行走的偷拍器... 王琦 从日常生活中的即时记录,到机场、课堂、医院等多种场景下的专业辅助,智能眼镜勾勒出一幅“抬眼即知...
2026未来科学大奖获奖人公布... 8月13日,未来科学大奖评审委员会公布2026年获奖名单:中国科学院生物物理研究所研究员张宏因其在揭...
数量翻两番!2056台机器人将... 第二届世界人形机器人运动会将于8月22日在国家速滑馆“冰丝带”盛大开幕。 在8月13日举行的新闻发布...
张雪机车获红杉中国投资,估值半... 近日,张雪机车宣布完成新一轮融资,红杉中国以 1.5 亿元主投,老股东高信资本跟投,投后估值达到 6...
腾讯总裁刘炽平:微信将建成 A... 来源:环球网 【环球网科技综合报道】8月13日消息,在近期的腾讯 2026Q2 财报业绩电话会上,腾...
比想象来得更快!脑机接口从“黑... 2026年8月12日,浙江省人民政府办公厅公开《关于推进脑机接口产学研联动的若干措施》。文件提出,到...
罕见表态,张一鸣全面升级AI大... 不蒸馏,练内功。 文 | 华商韬略 杨彼得 沉默已久的张一鸣,再次成为中国AI圈的焦点。 8月5日,...
PQMagic后量子密码开源社... (来源:上观新闻) 8月12日,由中央企业量子人才科创空间、上海交通大学等单位联合发起的PQMa...
扬州打造“15分钟便民技能学习... 8月12日晚,“人工智能应用培训与实操课”第4课准时开讲。扬州人才客厅二楼培训室内座无虚席,授课讲师...