研究:2019 至 2025 年预训练效率提升主要来自数据

By: www.dwarkesh.com|2026/09/09 09:12:10

研究分析了 2019 至 2025 年预训练进展中数据与模型改进的贡献。研究在较小规模上进行,使用每年公开的模型配方与数据语料,在最高 1e19 FLOPs 的训练计算规模上组合训练。结果显示,在 1e19 FLOPs 计算预算下,数据改进带来的计算效率增益为 12.0 倍,模型改进为 3.7 倍,数据侧增益约为模型侧的 3.24 倍。数据与模型改进的增益大体独立,几乎不交互,线性模型下二者加性效应可解释 OLMES 分数 88% 的方差。模型侧从 GPT-2 演进至 OLMo-2,涵盖优化器、位置编码、归一化、激活函数与初始化等。数据侧从 2019 年约 90 亿 token 的 OpenWebText,演进至 2025 年规模更大、过滤更精细的 UltraFineWeb 等语料。

本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

猜你喜欢

iconiconiconiconiconicon
客户服务:@weikecs
商务合作:@weikecs
量化做市商合作:bd@weex.com