动察 Beating AI 快讯,AI 编程公司 Magic 发布预训练研究,称一套新的训练方案只需约 50 万美元的 GB200 算力,就能达到接近 DeepSeek V4 Pro Base 的预训练效果,所需计算量只有约 1/50。
Base 是只完成预训练、还没经过强化学习等后训练的底模。Magic 用没见过的代码、数学题和研究论文测试模型,看谁预测后续内容更准。因此这里比的是底模预训练效果,不代表聊天、Coding 或 Agent 能力已经追平 DeepSeek V4 Pro 成品版。
Magic 随后把训练规模扩大了 10 倍,约合 400 万美元的 GB200 算力。这一版本在同一套自测中,超过了它测试的 DeepSeek、Kimi 和 NVIDIA 最新公开 Base 模型。Magic 估算,如果按 DeepSeek V4 Pro 的训练效率做到同等水平,算力成本将超过 1 亿美元。
Magic 没有公布完整训练配方,只透露效率提升来自模型架构、优化器、训练目标和数据处理等几十项改动。目前模型权重也还没有发布,因此「50 倍效率」仍无法由外界独立复现。