万亿参数也救不了脏数据,国内大模型开始返工预训练
发布时间:2026-09-23
动察 Beating AI 快讯,雷峰网称,过去大半年,多家国内大模型厂商开始重做预训练,问题都指向数据。一家厂商曾花近一年训练万亿参数模型,实际效果却被参数量只有约 1% 的小模型反超。团队最后发现,问题出在训练数据。网页垃圾、重复语料、低质量标注混进训练集,再大的模型也吃不消。该案例来自匿名信源,具体公司尚未公开。腾讯混元已经公开重做了一轮。今年 2 月起,团队重建预训练和强化学习基础设施。此前媒体曾披露,老混元存在打榜数据混入训练集、标注规则混乱等问题。新团队重新定数据标准,清洗原有语料,Hy3 也把数据质量和多样性列为主要改进项。阿里和百度也在加码数据治理。Qwen3 用 Qwen2.5 系列模型清洗文档,还大量补充数学和代码合成数据。文心 4.5 则加入去重、低质量过滤、数据地图和人工复核。两家公司没有公开说自己曾因脏数据返工,但新一代模型都把更多功夫花在了数据处理上。----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考----------交流群:https://t.me/dunwangyuanhuiwang

动察 Beating AI 快讯,雷峰网称,过去大半年,多家国内大模型厂商开始重做预训练,问题都指向数据。


一家厂商曾花近一年训练万亿参数模型,实际效果却被参数量只有约 1% 的小模型反超。团队最后发现,问题出在训练数据。网页垃圾、重复语料、低质量标注混进训练集,再大的模型也吃不消。该案例来自匿名信源,具体公司尚未公开。


腾讯混元已经公开重做了一轮。今年 2 月起,团队重建预训练和强化学习基础设施。此前媒体曾披露,老混元存在打榜数据混入训练集、标注规则混乱等问题。新团队重新定数据标准,清洗原有语料,Hy3 也把数据质量和多样性列为主要改进项。


阿里和百度也在加码数据治理。Qwen3 用 Qwen2.5 系列模型清洗文档,还大量补充数学和代码合成数据。文心 4.5 则加入去重、低质量过滤、数据地图和人工复核。两家公司没有公开说自己曾因脏数据返工,但新一代模型都把更多功夫花在了数据处理上。

----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang