内网日志意外流出!代号 iris-alpha:OpenAI 悄悄测试的 GPT-5.6 藏了什么?(2026)
OpenAI Codex 后端路由日志里的一行记录,营销效果胜过一场发布会:几乎所有请求都映射到 gpt-5.5,却有一段会话短暂映射到 gpt-5.6。开发者 Haider 约在 2026 年 4 月 28 日 发现;之后日志中该条目消失。二次报道称内部代号如 iris-alpha(另有传闻 ember-alpha、beacon-alpha)及 150 万 token 探测——OpenAI 公开模型页均未确认。
本文面向关注 API 路由、预测市场与对齐事后分析的开发者,区分日志事实与发布炒作——而非产品发布稿。
为何一行路由日志对 API 猎手重要
Codex 是 OpenAI 的智能体编程入口——与 CLI 会话、OAuth 开发工具及决定线上流量的 rollout 映射同属一族。灰度名出现在此处通常意味着:
- 存在可运行检查点(不仅是训练运行名)
- 已接入生产 rollout 机制
- 评测流量在真实编程提示上测行为
这与传闻推文不同,也不是发布公告。Haider 将首次 gpt-5.6 目击形容为更接近故障或灰度滑漏,而非有意披露 (WaveSpeed 摘要)。
若你以跟踪模型为生,请结合 Codex CLI 定价,弄清在 gpt-5.5 上今日成本,再面对可能的静默升级。
可引用定义:Codex 灰度泄露是路由表中短暂将一小部分线上或半线上流量指向未发布检查点以作测量——映射纠正后即消失的条目。
Codex 路由日志泄露解剖
| 信号 | 观察到的内容 | 置信度 |
|---|---|---|
| 模型 ID | 灰度映射中出现 gpt-5.6,与主流 gpt-5.5 并存 | 高(多名开发者报告;曾短暂可复现) |
| 持续性 | 后续会话日志中该条目被移除 | 高 |
代号 iris-alpha | 出现在二次泄露汇总(36Kr、TestingCatalog、AIScroll) | 中(OpenAI 文档未载) |
| 上下文 150 万 | 开发者通过 Codex OAuth / OpenCode 探测声称 | 中(社区测量,非系统卡) |
| 2026 年 6 月发布 | Polymarket 约 89% 押注 6 月 30 日前(引自 2026-05-13) | 低–中(市场情绪,非 OpenAI 日程) |
ember-alpha / beacon-alpha | 博主 Leo / WinCentral 摘要中的额外内部标签 | 低(单源链条) |
时间线(公开重建)
- 2026 年 4 月下旬 — Haider 在 Codex 日志中发现一处
gpt-5.6映射;视为灰度噪音。 - 2026 年 5 月上旬 — 更多开发者报告 OAuth 调用;部分先见
model is not supported,后用 Pro token 成功(社区报告)。 - 2026 年 5 月中旬 — 预测市场押注 6 月发布;科技媒体放大
iris-alpha代号。 - 2026 年 6 月(观察窗口) — Dev Day / 夏季发布传闻高峰;截至发稿无公开 OpenAI 模型卡。
外部参考:WaveSpeed 泄露梳理、TestingCatalog 150 万上下文探测。
iris-alpha:代号可能意味着什么
OpenAI 很少评论内部代号。将 iris-alpha 视为灰度通道标签,而非产品名:
- Iris — 光学/感知隐喻;或暗示多模态或“看见”代码/UI 上下文(推测)。
- Alpha — 预发布训练线,非 GA 质量门槛。
- 并列标签(
ember-alpha、beacon-alpha)— 若属实,或表示编程/推理/长上下文配置的 A/B 灰度——非三个消费级 SKU。
何种信号可官方确认 iris-alpha?
- OpenAI 模型目录出现
gpt-5.6 - 系统卡 + 部署安全中心页面(GPT-5.5 曾一并发布)
- Codex CLI 默认版本升级并在发布说明中点名检查点
在此之前,grep 日志胜过标题党。
哥布林背景:GPT-5.6 为何可能加速
泄露时点距 GPT-5.5 约三周,但动机故事更早。2026 年 4 月 30 日,OpenAI 发布 Where the Goblins Came From——关于 Nerdy 人格奖励塑形污染的复盘:
| 指标(OpenAI 事后分析) | 数值 |
|---|---|
| Nerdy 人格中 goblin 提及 vs GPT-5.2 基线 | +3,881% |
| 来自 Nerdy 人格的 goblin 提及占比 | 66.7% |
| 使用 Nerdy 人格的 ChatGPT 流量 | 2.5% |
| GPT-5.1 之后 goblin 提及增长 | +175% |
| RL 对 goblin/gremlin 输出打更高分的数据集占比 | 76.2% |
机制:极小人格切片塑造奖励信号;高分“生物隐喻”补全回灌 SFT;行为在模型中全球化。OpenAI 于 2026 年 3 月 下架 Nerdy,并紧急在 Codex 系统提示中四次重复禁 goblin 规则。
开发者为何要关心: GPT-5.6 灰度流量或在测奖励审计修复与人格隔离——不仅是 Terminal-Bench 多 5 分。路由字符串看不见这些,却更能解释压缩的发布节奏,胜过“营销要 6 月头条”。
证据矩阵:真发货还是烟雾
| 说法 | 较可能为真 | 仍为传闻 |
|---|---|---|
Codex 基础设施中的实验性 gpt-5.6 检查点 | ✓ | |
| 2026 年 5 月公开 API GA | ✓ | |
| 首日所有用户 150 万上下文 | ✓(探测 ≠ 产品承诺) | |
| iris-alpha 是唯一内部名称 | ✓(多标签报告冲突) | |
| 三周内重大架构重写 | ✓(节奏更像增量) | |
| 因 Polymarket 而 6 月 30 日发布 | ✓(预测市场常失误) |
独立开发者: 在你信任的基准动起来之前,假定增量编程/智能体提升——而非推特截图。
构建者清单:GPT-5.6 GA 前六步
步骤 1 — 生产环境钉死显式模型 ID
在 Codex CLI 与 API 中使用 gpt-5.5(或你审计过的版本串),勿用浮动 -latest 别名。静默升到灰度检查点即泄露变故障。
步骤 2 — 本地记录路由元数据
在 Codex 或兼容客户端开启详细/调试日志。按请求保存 model、system_fingerprint 与路由头——你自己的灰度探测器。
步骤 3 — 对 GPT-5.5 做 goblin 频率审计
抽样 500+ 条与奇幻无关的生产补全。若 goblin/gremlin/troll 密度超 0.5%,说明系统提示补丁后仍有可测漂移——供日后对比 GPT-5.6。
步骤 4 — 准备留出评测,而非体感
保留 20–50 个带通过/失败测试的真实仓库任务。新模型上线首日重跑同一 harness——见 8B 智能体调优,结构化评测胜过聊天截图。
步骤 5 — 盯官方渠道,不只 X
关注:OpenAI 模型文档、系统卡、Codex 发布说明、奖励审计第二篇博文(哥布林之后)。
步骤 6 — 设置 2026 年 6 月提醒栈
日历提醒 OpenAI Dev Day / 夏季活动;Polymarket 仅作情绪参考,非 CI 触发器。
2026 年 6 月值得关注的信号
- 重复出现的灰度映射(评测常态化后泄露会叠加)
- 系统卡出现“奖励校准”或人格隔离新表述
- CLI
--version中 Codex 默认版本抬升 - 定价页变化(OpenAI 很少立刻为小版本调价——不变也是信号)