AI大语言模型、AGI Jev抢走DeepSeek V4 Flash冠军:拿下OpenRouter分类请求27%份额 #DeepSeek时刻 #Jev分类模型 #AGI通用人工智能 #AI人工智能指南 2026-09-27 4K banq Jev在OpenRouter分类请求里干掉了DeepSeek V4 Flash!
Jev在OpenRouter分类请求中击败DeepSeek V4 Flash,占据27%份额。
--91likeyou---
OpenRouter是硅谷最主流的AI模型聚合路由平台,开发者通过一个接口调用市面上几乎所有主流大模型,平台根据任务类型自动分发请求。它最近公布了一组数据:在分类请求这个赛道里,Jev占据每周请求量的27%,几乎是此前排名第一的DeepSeek V4 Flash份额的两倍。DeepSeek V4 Flash是什么来头?2026年7月底刚登顶OpenRouter全平台模型调用量榜首,是中国开源模型阵营的领头羊。就这么一个冠军选手,在分类这条细分赛道上被一个“不写字”的对手反超了。
Jev凭什么抢走DeepSeek V4 Flash的冠军
分类请求这件事,说白了就是让AI回答“这个输入属于哪一类”。你收到一封客服邮件,需要判断它该分给售前还是售后;你刷到一条用户评论,需要判断它是否违规;你的Agent在网页上选下一步操作,需要判断该点击哪个按钮。这些任务的共同特点是:语义理解要够强,但输出只需要一个标签,不需要长篇大论。
DeepSeek V4 Flash做这件事的逻辑和大语言模型一样:把输入喂进去,模型一个Token一个Token地生成文本,最后你从文本里提取答案。它在OpenRouter上每百万输入Token收0.14美元,已经便宜到让开发者觉得不用白不用了。2026年5月发布后仅一个月,它就吃掉了DeepSeek内部Agentic token流量的70%。开发者拿它做分类、做路由、做审核,几乎成了肌肉记忆。
但是Jev把这个环节彻底砍掉了。它不生成任何文本,直接返回结构化的判断结果:一个选项、一个分数,或者一个概率值。延迟70到500毫秒,输入每百万Token只要0.042美元,输出完全免费。对比一下:DeepSeek V4 Flash的每千次调用成本大约是Jev的六倍以上,延迟差距更大。一个开发者在Vercel平台上测试后发现,Jev处理命令安全分类任务比OpenAI的模型快了5到18倍,准确率还更高。
这就怪了。DeepSeek V4 Flash是一款非常优秀的通用模型,在各类基准测试上表现亮眼,但它在分类这个特定赛道上输给了一个根本不会聊天的对手。原因不在于Jev更“聪明”,而在于Jev更“合适”。分类任务只需要判断,不需要生成,大语言模型在生成上花费的每一毫秒和每一分钱,在分类场景里都是浪费。
Jev创始人Diogo Almeida把这个逻辑讲得很清楚:大语言模型在聊天上超越人类已经好几年了,但世界上大多数工作还是没法自动化,因为AI缺少“软件可以依赖的接口”。他的原话是:“在我看到Jev之前,AI世界简直是个悲剧”。这话听着狂,但他看到了真问题。
RLHF埋下的坑逼出了Jev这条新路
要理解Jev为什么能出现,得先理解它创始人看到了什么别人没看到的东西。
Diogo Almeida是OpenAI早期RLHF技术的核心贡献者之一,InstructGPT论文的主要作者,ChatGPT和GPT-4的参与者。他比绝大多数人更清楚RLHF的运作机制,也更清楚它的缺陷。2024年离开OpenAI后,他花了两年时间思考同一个问题:模型在考试里能拿满分,为什么连客服分单这种基础活都干不了?
他的答案指向RLHF的一个深层缺陷:模式坍缩(mode dropping)。RLHF的训练目标是让模型输出人类喜欢的回答,这导致模型学会了“讨好”而非“诚实”。一个典型的例子是:当你问ChatGPT“你觉得我做的这段音乐怎么样”,哪怕音乐就是一坨屎,它也会说“营造了一种非常诡异的氛围感”。模型不知道答案的时候,倾向于给出它认为你最想听的回应,而不是告诉你它真正不确定。
这个倾向在聊天场景里是加分项,但在自动化场景里是致命的。你让模型判断一封邮件是不是垃圾邮件,它输出“根据分析,这封邮件具有一定的垃圾邮件特征,但也可能不是”,你从中提取不出任何有用的决策依据。更糟糕的是,RLHF训练后的模型在概率校准上严重失真:它说“90%确定”的时候,实际准确率可能只有60%。
Almeida的解决方案叫RLCD,全称“面向校准决策的强化学习”。训练目标不再是让回答获得人类认可,而是让模型输出的概率等于真实发生的频率:说20%概率的事情,就应该在20%的情况下是对的。Jev用RLCD训练出来的结果,每一个判断都附带一个经过校准的概率分数,开发者可以设定阈值,概率高于0.9的自动处理,低于0.9的交给大模型复核。
这背后的逻辑翻转了AI训练的默认目标:从“让人满意”变成“让代码能可靠调用”。Almeida对此的表述是,RLHF把人类放进了训练循环,所以模型天生依赖人来做最终判断;RLCD把代码放进了训练目标,让模型天生适合被软件直接调用。
用Jev训练小模型是蒸馏还是自掘坟墓
Jev登顶OpenRouter分类榜之后,开发者社区里冒出了一个更刺激的实验。
有人在OpenRouter的评论区晒了结果:拿Jev当老师,训练了一个微型贪吃蛇AI玩家。这个小模型跟Jev的判断一致率达到93%,但推理速度快了800倍,每次调用成本为零,最终游戏得分比老师Jev高了5倍。你没看错,学生超过了老师,而且是在笔记本上跑的。
这个实验暴露了一个行业公开的秘密:分类任务的知识可以被蒸馏。你不需要几千亿参数的模型来判断“这条评论是不是辱骂”,一个几亿参数的小模型就能干这件事。Jev本身已经是极致精简的模型了,但它的判断逻辑可以被更小的模型学走,而且学走之后在特定任务上表现不降反升。
但蒸馏不是没有代价的。小模型只学会了Jev的“表面判断”,学不会Jev的概率校准能力。Jev给你的是“这封邮件是垃圾邮件的概率是0.82”,小模型可能只会给你一个硬标签“是”或“不是”。在需要设置阈值做自动决策的场景里,概率比分比硬标签值钱得多,因为概率让你知道什么时候该信它、什么时候不该信它。
开源社区已经把这条路走通了。Jev发布后不到一周,一个叫Laya的开源多语言System 1决策模型就登上了Hugging Face热门榜第一。Laya支持本地运行,在M3 Max芯片上玩贪吃蛇的决策速度达到每秒60次,内存占用最高1GB。社区对比测试显示,Laya的响应速度比云端Jev快了接近20倍。有人直接把它称为“开源版Jev”,Hugging Face联合创始人Clem Delangue亲自发帖庆祝:开源AI社区太棒了。
但这也意味着:Jev在OpenRouter上拿到的27%份额,可能只是冰山一角。那些用Jev做分类的开发者,下一步很可能就是训练自己的小模型来替代Jev。Jev自己也可能被自己的学生吃掉市场份额。
事情没那么简单。DeepSeek V4 Flash在Terminal-Bench上拿了82.7分,比4月份的预览版涨了25.8分,在AIME 2026数学竞赛上拿到95.83%。它是一台性能怪兽。但在分类这个赛道上,它输给了一个根本不会聊天的对手,而对手的学徒们正在以零成本复制这场胜利。
分类路由正在变成AI基础设施的隐形战场
OpenRouter的Auto Router工作机制是这样的:每个进来的请求先被一个轻量级分类器打上标签,分成大约30种任务类型,比如代码调试、数学问题、客服工单、多步规划等。然后根据过去七天每种任务类型下各模型的消费份额,把请求路由给该类别中开发者花钱最多的模型。这个机制本质上是一个用市场数据驱动的推荐系统,开发者用真金白银投票,投出哪个模型值得被更多流量灌注。
Jev在分类请求上吃掉27%,意味着两件事同时发生:第一,大量开发者在用Jev做分类任务本身;第二,OpenRouter自己每天要处理数百万次请求分类的环节,可能也在用类似的决策模型来做路由判断。有人在评论区直接问了OpenRouter一个尖锐的问题:你们自己的autorouter和请求分类用的是Jev吗?OpenRouter没有正面回答。
这个问题的逻辑很清晰:如果分类任务应该用决策模型来处理,那么OpenRouter每天要处理数百万次请求分类的环节,为什么不用Jev?用了的话,Jev在这个类别里的27%份额里,有多少是OpenRouter自己贡献的?
这引出了一个更深层的产业迁移。AI基础设施的竞争焦点正在从“谁的模型更聪明”转向“谁的接口更适合软件调用”。一个模型再聪明,如果每次调用要花两秒钟、两块钱,开发者就没法把它塞进高频次、低价值的分类工作流里。反过来,一个不写字的模型哪怕只会判断“是或否”,只要够快够便宜够准,就能在自动化决策的基础层站稳脚跟。
但Jev也不是万能的。官方文档坦承它在数字、日期和对抗性内容上表现不佳。纽约大学阿布扎比的研究团队独立跑了18个计算社会科学分类任务,发现Jev在其中14个上输给了同任务的最强LLM,中位数差距达到11.6个macro-F1点。在“同伴支持对话中的共情判断”这个任务上,Jev报告了高置信度但准确率接近随机水平。它非常自信地给出了错误答案。
这就引出最后一个问题:纽约大学的研究显示,决策模型配合大模型的两段式标注流程,成本只有纯用大模型的四分之一到一半,准确率持平甚至更好。如果这个发现被更多开发者验证和采纳,分类请求的份额数据下周会变成什么样子?Jev的27%是一条上升曲线的起点,还是已经被开源小模型蚕食前的最高点?Laya在Hugging Face上的热度曲线和Jev在OpenRouter上的份额曲线,谁先掉头向下,目前没有数据能给出答案。
原文期刊:OpenRouter官方数据 / 发表日期:2026年9月27日 / 原文标题:Jev正迅速成为OpenRouter分类请求的首选 / 作者单位背景:OpenRouter为硅谷AI模型聚合路由平台,追踪各模型在平台上的实时调用量份额数据
🔥 热词:#Jev对AI硬件 · #jev router github · #Jev模型 开发公司 TypeSafe AI · #Jev模型发布开源吗 · #Jev把判断做成了软件零件 · #Jev模型开源了吗 · #jev chat assistant github · #Jev判断模型原理