欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

GPT-5.5 Codex 推理 Token 聚类异常:固定阈值导致复杂任务性能下降

2026/7/5人工智能

GPT-5.5 Codex 模型在推理 Token 计数上出现 516/1034/1552 的固定值聚类,伴随整体推理强度下降,可能解释了复杂任务性能退化。

背景:一个令人不安的发现

2026 年 6 月 27 日,一位名叫 vguptaa45 的开发者在 OpenAI Codex 仓库提交了一个 issue(#30364),报告了一个令人担忧的模式:GPT-5.5 模型的推理输出 Token 数(reasoning_output_tokens)异常集中在 516、1034 和 1552 这三个固定数值上,而不是呈现自然分布。这种聚类现象与模型在复杂/高风险任务上的性能退化高度相关。

此 issue 关联到另一个更早的报告(#29353),其中有人复现了一个任务级问题:当 GPT-5.5 的推理 Token 恰好停在 516 时,它返回了错误的答案。而 #30364 则提供了在更大时间窗口(2026 年 2 月至 6 月)内的聚合证据,使问题从个案升级为系统性异常。

核心数据:390,195 次响应的统计学证据

分析基于 Codex 的 token_count 元数据,覆盖 2026 年 2 月 1 日至 6 月 27 日 UTC 时间窗口。

总体统计

  • 分析的响应级 Token 记录:390,195 条
  • 涉及会话:865 个
  • 精确命中 reasoning_output_tokens = 516 的事件:3,363 次
  • GPT-5.5 占所有响应的比例:19.3%
  • GPT-5.5 占精确 516 事件的比例:82.0%
  • GPT-5.5 中精确 516 占 >=516 的比例:44.0%
  • 非 GPT-5.5 模型中该比例仅为:1.3%

这意味着:GPT-5.5 只贡献了不到五分之一的响应,却贡献了超过五分之四的 516 异常事件。其聚类强度是非 GPT-5.5 模型的约 33.6 倍(44.0% / 1.3%)。

模型间对比

模型 响应记录数 精确 516 / >=516 比例
gpt-5.5 75,401 44.0%
gpt-5.4 25,214 19.8%
gpt-5.2 247,575 0.34%
gpt-5.3-codex 13,333 0.0%
gpt-5.3-codex-spark 26,179 0.0%

关键发现:gpt-5.4 也有一定程度的聚类(19.8%),但远低于 gpt-5.5。而 gpt-5.2 和 Codex 专用变体几乎不受影响。这表明该问题具有模型特异性,很可能与 gpt-5.5 的推理架构或调度逻辑有关。

时间趋势:聚类急剧上升,推理强度同步下降

月份 精确 516 / >=516 比例 平均推理 Token P90 推理 Token
2026-02 0.11% 268.1 772
2026-03 2.45% 256.8 723
2026-04 4.25% 228.7 669
2026-05 53.30% 106.9 344
2026-06 35.84% 168.5 515

两个同步趋势:

  1. 聚类率飙升:从 2 月的几乎为零(0.11%)暴涨到 5 月的 53.30%,意味着超过一半的 >=516 Token 响应都精确停在 516。6 月虽有所回落(35.84%),但仍处于极高水平。
  2. 推理强度骤降:平均推理 Token 数从 2 月的 268.1 降至 5 月的 106.9,降幅达 60%。P90(第 90 百分位)从 772 降至 344,降幅达 55%。6 月略有回升,但仍远低于 2-4 月水平。

为什么这很可疑:如果模型只是更频繁地生成短推理,那么平均 Token 数下降的同时,分布应该是连续的。但这里出现的是离散的固定值尖峰,且与推理强度下降同步发生。这强烈暗示存在某种阈值化的推理预算行为——模型被强制截断或回退到固定的推理长度。

技术分析:516/1034/1552 意味着什么?

这三个数值(516、1034、1552)本身就很可疑。它们看起来像是重复的阈值边界:

  • 516 ≈ 512(2^9)+ 4(可能是元数据开销)
  • 1034 ≈ 516 × 2
  • 1552 ≈ 516 × 3

这种等比关系暗示可能存在一个分层预算机制:

  • 基础层:516 Token(最小推理预算)
  • 扩展层:1034 Token(2× 基础)
  • 最大层:1552 Token(3× 基础)

当模型需要更多推理时,不是平滑地增加 Token,而是跳转到下一个固定档位。这类似于某些系统中为控制成本而设置的“推理等级”(reasoning tiers)。

可能的根本原因

Issue 作者谨慎地指出,他并非在证明存在“隐藏的思维链截断”,但提出了几种合理的解释:

  1. 推理预算(Reasoning Budget):OpenAI 可能为 gpt-5.5 设置了硬性的 Token 预算上限,当模型即将超过预算时,强制截断输出。516 可能是默认的最小预算值。

  2. 路由回退(Routing Fallback):当复杂任务需要更多推理时,系统可能将请求回退到更低成本的模型或模式,而这些模式恰好以 516 Token 终止。

  3. 调度器行为(Scheduler Behavior):存在一个调度器,根据负载或成本动态分配推理资源,当资源不足时使用固定长度的“快速路径”。

  4. 截断机制(Truncation):模型内部有一个隐式的“思维链截断点”,当链式推理超过一定步数时被强制结束。

  5. 评估指标污染:如果内部评估时发现 516 Token 响应在简单任务上表现不错,可能被错误地视为“足够好”,从而被优先采用。

对用户的影响

对于使用 Codex 进行复杂编程任务(如多文件重构、算法设计、安全审计)的用户,这可能意味着:

  • 答案质量下降:模型没有进行充分的推理就过早输出,导致逻辑漏洞或错误。
  • 不可预测性:同一任务多次提交可能得到不同质量的答案,因为有时模型会“允许”更多推理,有时则被限制在 516 Token。
  • 成本浪费:用户支付了全价,却只获得了“截断版”的推理。

验证建议

Issue 作者为 OpenAI 团队提供了具体的验证方法:

  1. 按模型查询 token_count 事件中的 reasoning_output_tokens 字段。
  2. 比较 0、516、1034、1552 这些精确值的计数。
  3. 计算 count(=516) / count(>=516) 按模型和日期的比率。
  4. 特别对比 gpt-5.5 与 gpt-5.2、gpt-5.4 及 Codex 专用变体。
  5. 在匹配的复杂任务上重放测试,分别评估精确 516 响应和更长推理响应的质量。

更广泛的启示

这个 issue 揭示了现代 AI 系统中的一个深层问题:当模型推理过程被非功能性约束(成本、延迟、配额)干预时,性能退化往往以隐蔽的方式出现。用户看到的是一段看似完整的推理,但实际上它可能被提前截断。

对于开发者社区而言,这是一个警示:不要盲目信任模型输出中的“推理 Token 数”作为质量指标。固定数值的聚类可能意味着系统在背后做了你不希望的事情。

原文链接

https://github.com/openai/codex/issues/30364

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消