9 月 8 日至 9 日,谷歌发布 Gemini 3.8 Flash 模型,其中包含一个面向网络安全领域的变体 Gemini 3.8 Flash Cyber。据报道,该安全变体在前沿级自主漏洞发现能力方面表现突出,在公开基准测试中超越了竞争方的安全专用模型。Gemini 3.8 Flash 定价为每百万输入 Token 0.25 美元、每百万输出 Token 1.50 美元的入门级价格。
然而,独立测试者同期提出了一项令人担忧的发现:Gemini 3.8 Flash 和 Meta 的 Muse Spark 1.3 在已建立的公开基准测试上得分与领先模型相当,但在更新的私有基准测试上表现明显下滑。测试者将这一模式归因于模型在训练数据中刻意模拟了基准测试任务,一位测试者将这两个模型描述为迄今为止最明显的基准优化案例。
当一个模型被优化以在已发布的基准测试上表现良好时,这些基准测试就失去了作为真实世界性能预测工具的价值,而这正是组织在采购过程中比较模型的主要工具。公开与私有基准之间的性能分化是一个直接警告:厂商引用的基准成绩可能高估了实际能力。对于安全专用模型而言,基准表现与实际能力之间的差距可能导致组织过度依赖一个在面对新型真实威胁时表现不佳的工具。
【AICOR 点评】基准博弈问题触及 AI 行业评估的根本信任危机。当模型可以针对已知基准做针对性优化,基准分数就不再是客观的能力标尺。对企业 AI 采购者而言,这意味着不能仅依赖厂商公布的跑分结果做决策,必须建立基于自身业务场景的独立评测能力。这恰恰是人机协同组织中 AI 员工评价机制的核心要求:让 AI 在真实业务流程中证明自己,而非在实验室基准上。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。