行业观察

只改开头两个 Token,基础模型数学成绩追平强化学习版本

Publicado 2026-10-11 Autor Fuente 智东西 · https://dy.163.com/article/L8ST5HDP051180F7.html · 2026-10-10 Etiquetas Organización Nativa IA / Auto-Caso / Lanzamiento
MIT 等机构研究发现,固定基础模型回答的开头两个 Token,即可让数学推理准确率从 42% 升至 78%,超过其强化学习版本。

智东西 10 月 10 日报道,一项来自 MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究发现:只要把基础模型回答的开头固定为特定 Token 序列,模型的数学推理成绩就能接近甚至超过对应的强化学习版本。以 Ai2 基础模型 Olmo-3-7B 为例,将回答固定为特定开头后,其在 MATH-500 上的准确率从 42% 升至 78%,超过强化学习版本的 75%——全程没有修改模型参数,也没有增加解题示例。

研究的线索来自一个反常观察:正确答案中约半数以同样的句号加换行开头,错误答案中这一比例只有 14%。论文已于 10 月 5 日提交,研究者认为,基础模型答错有时并非不会做,而是没有进入解题状态;强化学习的部分作用,可能正是让模型更容易选到这种有效的回答起点。

【AICOR 点评】这类发现的价值不在刷分技巧,而在揭示一个朴素的工程真相:模型能力的发挥高度依赖调用方式。对企业来说,提示词设计、输出引导这些「软工程」往往比更换更强的模型性价比更高。在追逐更大模型之前,把已有模型的调用姿势调对,可能就释放了大量沉睡能力。

Aviso de Copyright Este artículo está asistido por IA, reescrito a partir de reportajes públicos. El copyright de la información pertenece a los autores y medios originales; el contenido es solo para compartir información del sector y no constituye asesoramiento de inversión ni comercial.

Por cuestiones de copyright, contacte a AICOR (400-601-8080 / WeChat: aicor-ai); lo gestionaremos con prontitud al recibir la notificación.

← Volver a Noticias