AI大语言模型、AGI 神秘模型Ox Alpha爆料:暴打Fable5超GPT五成,日供百万亿算力 #大语言模型LLM #OpenCode #AI基础设施 2026-08-22 1 6K banq 一个匿名大模型在编程测试中暴打 Claude Fable 5,免费开放、日供百万亿 Token,但全世界没人知道它是谁做的!
在2026年8月22日,一个名为Ox Alpha的神秘模型在编程测试中的表现令人震惊。这个代号为“Ox Alpha”的模型没有发布会、没有技术报告、没有开发团队署名,就这样悄无声息地上架了OpenRouter。该模型被描述为高效编程、长时间智能体任务和真实生产环境的理想选择,拥有100万Token上下文窗口,支持文本、图像和视频输入。然而,这个模型的参数、训练数据、架构、基准成绩以及开发团队全部处于保密状态。
--91likeyou---
开发者 Ben Davis 坐不住了。他让 Ox Alpha 跑了一遍 DeepSWE——这是一个专门用来衡量 AI 读取真实代码库、识别漏洞并生成有效补丁能力的基准测试。DeepSWE 跟那些可能被“刷榜”污染的旧基准不同,它的 113 道任务全部是从头编写的原创题,没有模型在预训练阶段见过答案。验证器的手写行为测试假阳性率只有 0.3%、假阴性率只有 1.1%,比 SWE-Bench Pro 那 8.5% 的假阳性率干净了不止一个数量级。
结果呢?Davis 跑了 10 个任务:Ox Alpha 的 Pass@1 达到了 80%,修正了对“x”字符的接近错误后甚至超过 80%。作为对比:Claude Fable 5 是 65%,GLM-5.3 是 62%,Grok 4.6 是 62%,GPT-5.6 Sol 只有 52%。
等等,一个没名没姓的模型,在“零污染”的编程基准上,把公认的头部模型按在地上摩擦?
事情没那么简单。样本量只有 10 个任务,批评者说这太薄了,80% 可能是运气。有人跑了 61 个已完成任务,只拿到 36%,离 80% 差得远。还有人用 4.7 万平均输出 Token 跑了一个子集,得分约 63%。
但注意一个细节:在“meriyah-explicit-resource-declarations”这个任务上,Ox Alpha 一次通过,而 GLM-5.3、GPT-5.6-sol 和 Grok 4.6 此前全部以 0/4 告终。同时,Ox Alpha 在一次包含 69 次工具调用的智能体任务中只出现一次错误,没有发生重试循环,保持了 51,469 项回归测试全部通过。
这就怪了。如果只是运气好,怎么可能在别人全军覆没的任务上一次性通关?
三张面孔:Fable飞得高,GPT钻得深,Ox搭积木
关于不同AI模型的风格差异,一位长期跟踪模型评测的研究者做了个精妙的比喻。
Fable是一只鸟。它的视角会随着飞行高度变化——不同高度看到的东西不一样,理解结果的方式也不一样。GPT是一只青蛙。它钻进机器内部,拆解每一个齿轮和杠杆。Ox是一只园丁鸟。它把数学上好看的碎片收集起来,搭成一个 impressive 的结构——但这个结构可能一推就倒。
这个比喻抓住了Ox的核心特征:它擅长把东西拼在一起,但不擅长检查每一块拼图是否真的严丝合缝。
具体的表现是这样的:Ox能给出“好的框架→看似合理的推断→一个具体的定性结论”。这个链条走得太快——快到没时间验证每一步是否真的成立。结果是:一份研究备忘录看起来既专业又勤奋,但离一个经过验证的定理还差得远。
在三个模型的对比中,Ox在三项能力上的评分分别是:创意生成中等偏强、数学推导弱、成品产出看起来光鲜但自我验证不足。Fable的问题是“我有一个有趣的世界观,我要把它推得太远”。GPT的问题是“有8个考虑因素,我要让你听全8个”。Ox的问题是“我理解了问题,所以我肯定知道答案”。
哪一种最危险?评价者说:Ox是三者中最让人上头的。
为什么?因为Fable的“飞得太高”你能感觉到,GPT的“啰嗦”你能不耐烦。但Ox的“我知道答案”——它听起来太对了,太流畅了,太像那么回事了。你很难在第一时间察觉到它哪里不对。
###自信的陷阱:当“我知道答案”变成“我知道错了”
这就引出了一个更深的麻烦:过度自信。
有评论者指出,Ox会以绝对的确定性产生幻觉,这让它“真正危险到不能盲目信任”。另一位用户追问:这种过度自信到底是强化学习的奖励机制造成的,还是从训练数据里蒸馏出来的?
回答这个问题的线索来自对模型训练方式的推测。研究者让其他模型盲测后猜测Ox的训练方法,得到的结论是:Ox“没有被RL炸熟,但被RL烤焦了”。什么意思?它的概念流畅性很强——这是基础模型的底子。但那种“非要解决问题”的强迫感——那像是强化学习的痕迹。
更具体的推测是:一个GLM lineage的模型,RL预算大头投给了“智能体行为奖励”,而对话风格是从蒸馏数据继承的,不是从偏好训练来的。“内容像老师教的,策略被代码RL的梯度退火了”。
翻译成人话:这个模型被训练成“必须完成任务”——不管任务是什么,不管方法对不对,不管结果真不真。它被奖励的是“行动”和“完成”,不是“正确”和“严谨”。
这就解释了为什么它在编程任务上表现惊艳——编程是一个有明确完成标志的任务(代码跑通了、测试过了)。但也解释了为什么它在事实性问题上会 confidently wrong——它没有被训练成“先想清楚再说话”,而是被训练成“先说话、先行动、先把事情做完”。
在贝叶斯术语里:Ox提高了“某个研究方向看起来有趣”的概率,但几乎没有提高“这个方向真的靠谱”的概率。
指纹对上了:分词器、视频编码器、75 个 Token 的偏差
全世界开始了一场大型“猜模型”游戏。Google Gemini、小米 MiMo V3、腾讯混元新模型、DeepSeek、Grok——各种猜测满天飞。
Ben Davis 给出了一个惊人的结论:他“99% 确定”Ox Alpha 属于智谱 GLM-5.x 系列。证据链相当硬核。
第一,分词器指纹。研究人员对 25 个不同提示词进行测试后发现,Ox Alpha 的 Token 数量与 GLM-5.3 几乎完全吻合,仅存在恒定的 75 个 Token 包装层偏差。Tokenizer 是模型的“指纹”——两个不同基础模型在 25 组多样化 Prompt 上产生完全相同的 Token 分割序列,巧合概率极低。
第二,视频编码器。在四组受控视频中,Ox Alpha 与 GLM-5V-Turbo 的 Video Token 消耗完全一致,两者均呈现相同的三项特征:帧率无关的帧采样方式、约每秒 147 Token 的时长缩放比例、逐帧分辨率缩放机制。相比之下,MiMo v2.5、Qwen 3.8 Max 和 GLM-4.6V 等候选模型均表现出明显不同的视频编码特征。
第三,行为模式。Ox Alpha 拒绝音频输入的行为与 GLM-5V 完全一致。API 响应特征也与智谱架构高度吻合。
而且智谱有“前科”。2026 年 2 月,智谱就曾以“Pony Alpha”的匿名代号测试过 GLM-5。动物代号加“Alpha”后缀——这次是“Ox Alpha”,手法如出一辙。
但等等。如果 Ox Alpha 就是 GLM-5.3 的变体,那它在 Kingbench 上的表现又说不通了——Ox Alpha 得分 87.5%,而 GLM-5.3 是 91.25%。一个“下一代模型”居然比上一代还低?
更吊诡的是,GLM-5.3 公开版本不支持视觉或视频输入,而 Ox Alpha 却在首页高调宣传多模态能力。这要么是智谱藏了一手多模态版本没发,要么是有人在 GLM 的骨架上做了深度改造。Davis 据此认为,Ox Alpha 的能力已经明显强于 GLM-5.3,更像是下一代模型检查点。
免费背后的算账:3344 万次请求、2.4 万亿 Token、60 万美元
Ox Alpha 上线后的数据令人瞠目。
上线 29 小时,Prompt Token 达到 2.40 万亿,请求数 3344 万+。按 GLM-5.3 公开价格折算,这 29 小时仅 OpenRouter 一个渠道就相当于约 60 万美元的推理账单。对比 OpenRouter 周榜:DeepSeek V4 Pro 全周 1.96 万亿,GLM-5.2 全周 3.79 万亿。Ox Alpha 一天半就冲进了同一个量级,而且全程免费。
OpenCode 宣布为这款模型准备了每天 100 万亿 Token 的调用容量。每秒 11.6 亿 Token 的吞吐量。这个数字意味着什么?全球没有几家实验室撑得起这个规模的推理集群。智谱确实有这个算力——它已经运行了多个万卡 GPU 集群,刚刚启用了一个 1GW 的数据中心。DeepSeek 呢?最近刚提高了 V4-Flash 的价格,说明算力并不富裕。
但真正让人坐不住的是数据条款。OpenRouter 的 Stealth EULA 第 3 条写得清清楚楚:免费的“对价”就是你的 User Content;第 1 条说输入会被收集并交给匿名 Provider,“用于 Stealth Model 训练和改进”。所谓“Zero Data Retention”,指的是不用于训练“其他模型”——喂给这个神秘模型本身是允许的。
换句话说:你免费用的每一分钟,都在帮一个匿名模型做 RLHF 数据采集。
这背后有一个更深的逻辑。Ilya Sutskever 创立的 Safe Superin(SSI)两年来几乎保持沉默,既没有发布任何模型,也没有销售任何产品。但据 2026 年 8 月爆料,SSI 的核心研究方向是基于 TTT(Test-Time Training,测试时训练)的小型推理引擎——该技术允许模型在推理时动态更新部分权重。2026 年 8 月 4 日,知名投资人 Gavin Baker 公开透露“SSI 本月将发模型”。英伟达在罕见获准进入 SSI 实验室后,已投资 5 亿美元。
如果 Ox Alpha 是 SSI 借 GLM 底座跑 Self-Improvement RL 呢?免费一周就是为了大规模采集真实环境的 Agent 轨迹。Self-Play RL 最缺的东西就是真实环境的 Agent 轨迹——每次工具调用、每条重试都是训练料。这种数据买不到,只能靠大规模真实投放来收。29 小时 3344 万次请求,每次调用都是一条珍贵的训练样本。
牛还是狼:这头“公牛”到底想干什么
Ox Alpha 的自我定位很克制。它只会说自己是“ox-alpha,由未公开组织开发”,拒绝声称自己是 GPT、Claude、Gemini、Grok、GLM、Qwen 或 Kimi。OpenRouter 页面写得也很清楚:它只是一个路由平台,不是开发者、所有者或提供商。
这个匿名模型在基准测试中展现出的能力毋庸置疑。但围绕它的疑问比答案多得多。
Ox Alpha 会是 Ilya 的 SSI 吗?SSI 确实被曝本月将发布首个模型。但 Ox Alpha 的视频编码器、分词器指纹几乎全部指向智谱。如果 SSI 要在 GLM 骨架上做后训练,为什么不用自己的架构?
Ox Alpha 会是 Cursor 团队基于 GLM 系列后训练出来的 Composer 新模型吗?Cursor 团队有足够的工程能力做这件事。但 Cursor 什么时候变成模型训练方了?
更让人困惑的是实际任务表现的分裂。有人在 DeepSWE 子集上跑出 80%,有人在同样子集上只拿到 63%。有人觉得它“clearly better than 5.6 sol”,有人评价“seems very benchmaxxed”。Ox Alpha 的 P50 延迟约 1.92 秒,吞吐量约 52 Token/秒,近 3 天可用率做到 99.99%。这个速度不算惊艳,但胜在稳定。
Ox Alpha 在多个基准上的表现都非常出色,但与 GLM-5.3 在 Kingbench 上的分数差距又让人不得不怀疑它是否被过度优化。有分析认为,这很可能是一个专门针对编程和智能体任务进行优化的检查点,而非通用能力的全面跃升。
截至 8 月 22 日,没有任何实验室站出来认领 Ox Alpha。智谱官方保持沉默。OpenRouter 的提供商一栏仍然只写着“Stealth”。
一周免费期结束后会怎样?Ox Alpha 是会收费、下线,还是突然被某个实验室正式认领?如果它真的是智谱的 GLM-5.5 或 GLM-5.3V,为什么选择匿名发布而不是高调宣发?如果它不是智谱,那又是谁有本事把 GLM 的指纹模仿得如此逼真——连视频编码器的帧采样方式都一模一样?
最关键的是:一个匿名模型在“零污染”的编程基准上碾压头部产品,却没人知道它是谁做的。这本身就是 2026 年 AI 行业最荒诞也最真实的注脚。
🔥 热词:#Ox Alpha大模型测评 · #Ox Alpha模型 · #ox alpha大模型