在人工智能(AI)飞速发展的今天,一个广为流传的说法是:“只要喂给AI海量数据,它的表现就会越来越强。”不少企业甚至普通用户都认为,数据是AI的“万能灵药”,只要堆砌数据,模型就能自动学会一切。然而,这一观点真的成立吗?中国新闻网“中新真探”栏目近日邀请多位人工智能领域专家,对这一常见认知进行了深入剖析。

“数据至上”的误区

“数据越多,模型越好”的想法,源于近年来深度学习在大规模数据集上的亮眼表现。例如,GPT系列模型借助数十亿条文本训练,展现出惊人的语言生成能力;图像识别模型在千万级图片库上训练后,准确率甚至超越人类。这些成功案例容易让人产生错觉:数据是AI性能的唯一决定因素。

然而,中国人工智能学会副秘书长、北京邮电大学教授张伟指出:“数据量虽然重要,但绝非‘越多越好’。数据的质量、多样性、标注准确性,往往比数量本身更关键。”他举例说,如果训练数据本身包含大量噪声、错误标签或片面样本,模型不仅不会变聪明,反而可能学到错误的规律,从而在真实场景中表现糟糕。

数据陷阱:过拟合、偏见与“垃圾进垃圾出”

专家表示,盲目增加数据量可能带来三个典型问题:

第一,过拟合风险不减反增。 当数据量大但重复度高、分布不均衡时,模型容易记住噪声和低频模式,导致在未见数据上泛化能力下降。北京航空航天大学计算机学院研究员李敏解释:“一个极端例子是,某公司用100万张晴天拍摄的街景照片训练自动驾驶模型,模型在雪天、夜间等场景下几乎‘失明’。只因为数据虽多,但缺少关键变异性。”

第二,数据偏见被放大。 如果训练数据中某类群体或场景占比过高,AI会系统性歧视其他群体。此前有研究显示,一个基于海量网络图片训练的性别识别模型,对深色肤色女性的识别错误率是浅色肤色男性的数倍,根源就在于训练数据中肤色、性别比例严重失衡。

第三,计算成本与收益不成正比。 随着数据规模增长,所需的算力和存储成本呈指数级上升,但模型性能提升往往在达到一定阈值后趋于平缓。斯坦福大学《AI指数报告》显示,在多个经典任务上,数据量翻十倍,模型准确率可能只提升不到1个百分点。

数据之外:算法、算力与领域知识的平衡

中科院自动化研究所研究员王磊在采访中强调:“AI效果是数据、算法、算力和领域知识的综合结果。缺了一层,其他环节再努力也无济于事。”

他进一步指出,近年来“小样本学习”“少样本提示”等技术的兴起,恰恰说明优质数据比海量数据更具突破潜力。例如,OpenAI的GPT-3虽然拥有1750亿参数,但其后续的InstructGPT模型通过更高质量的标注数据和人类反馈微调,规模更小却在指令遵循能力上大幅超过原始版本。

“与其盲目搜集所有数据,不如精心设计数据集、清洗噪声、平衡分布,并配合高效算法。”王磊说,“很多顶尖AI实验室的工作重心已从‘数据搬运’转向‘数据工程’。”

真实案例:大型AI模型的“翻车”时刻

事实上,即使是行业巨头也难逃“数据幻觉”。2023年,某知名科技公司发布的医疗诊断AI系统,训练数据涵盖数千万份病历,但在实际医院试点中,竟将大量健康人群误判为早期癌症。事后分析发现,训练数据中大部分病例来自同一家医院,其影像设备型号和参数与外界不同,模型学会的只是“设备特征”而非疾病特征。

此外,在自然语言处理领域,即便用上整个互联网文本训练的大模型,也经常生成事实错误、逻辑混乱的答案。这说明数据量无法解决模型对知识真实性的根本理解问题。

结论:质量优先,而非数量迷信

综合多位专家观点,可以得出明确结论:“只要数据够多,AI效果自然就会好”是一个过于简化的误解。AI系统设计者需要清醒认识到:数据是燃料,但驾驶方向、引擎效率和路况环境同样关键。未来,随着AI应用深入各行各业,对数据质量、公平性、可解释性的要求只会更高。

中新真探建议,企业和研究机构在AI开发中应遵循“数据治理优先、算法适度匹配、效果持续验证”的原则,而不是陷入“越大数据越先进”的攀比陷阱。毕竟,一台装满劣质汽油的发动机,无论马力多大,都无法将汽车安全送达目的地。

(中新真探栏目 记者陈曦 实习生张小雨 北京报道)