行业观察

只改开头两个 Token,基础模型数学成绩追平强化学习版本

Published 2026-10-11 Author Source 智东西 · https://dy.163.com/article/L8ST5HDP051180F7.html · 2026-10-10 Tags AI-Native Organization / Self as Product / Launch
MIT 等机构研究发现,固定基础模型回答的开头两个 Token,即可让数学推理准确率从 42% 升至 78%,超过其强化学习版本。

智东西 10 月 10 日报道,一项来自 MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究发现:只要把基础模型回答的开头固定为特定 Token 序列,模型的数学推理成绩就能接近甚至超过对应的强化学习版本。以 Ai2 基础模型 Olmo-3-7B 为例,将回答固定为特定开头后,其在 MATH-500 上的准确率从 42% 升至 78%,超过强化学习版本的 75%——全程没有修改模型参数,也没有增加解题示例。

研究的线索来自一个反常观察:正确答案中约半数以同样的句号加换行开头,错误答案中这一比例只有 14%。论文已于 10 月 5 日提交,研究者认为,基础模型答错有时并非不会做,而是没有进入解题状态;强化学习的部分作用,可能正是让模型更容易选到这种有效的回答起点。

【AICOR 点评】这类发现的价值不在刷分技巧,而在揭示一个朴素的工程真相:模型能力的发挥高度依赖调用方式。对企业来说,提示词设计、输出引导这些「软工程」往往比更换更强的模型性价比更高。在追逐更大模型之前,把已有模型的调用姿势调对,可能就释放了大量沉睡能力。

Copyright Notice This article is AI-assisted, rewritten from public reports. Copyright of the information belongs to the original authors and media; content is for industry sharing only and does not constitute investment or business advice.

For copyright concerns, contact AICOR (400-601-8080 / WeChat: aicor-ai); we will handle it promptly upon notification.

← Back to News