AI端侧应用、氛围编程 Jev驱动语音助手突破:干掉Siri唤醒词,Jev本地分类器成关键 #Jev分类模型 #AI视频 #apple苹果科技 #机器人 2026-09-21 5K banq 唤醒词这个东西,可能马上就要被扔进垃圾桶了!
一个叫Toothless的小玩意,正在悄悄干掉"嘿Siri"这种别扭的开场白。
一位叫Ashutosh Purohit的开发者用一个叫Jev的新型模型,做出了一个能自己判断"你在跟我说话还是跟旁边人说话"的语音助手原型。核心机制是本地跑一个轻量分类器,实时判断每句话到底是不是对着机器讲的,不需要唤醒词,不需要按按钮,也不用假装在开一对一会议。
语音助手的老毛病,其实是一个哲学问题
你对着Siri说话之前,为什么一定要先喊一声"嘿Siri"?这个动作看起来很自然,其实藏着一个特别拧巴的设计缺陷。
机器没办法自己判断你说的话是不是在跟它说话,所以它需要你先举个手,喊个名字,做个仪式,告诉它:好,现在轮到你听了。这套流程叫做唤醒词检测(wake word detection),从2011年Siri诞生以来就是这么干的,亚马逊的Alexa、谷歌的Google Assistant全都照抄。
这就有点怪了!人跟人说话的时候,你会先喊对方的名字才开口吗?大部分时候不会。你只会看一眼对方,或者靠语气、靠上下文,对方就知道你在跟他讲话。机器为什么做不到这一点?
现在的语音AI,卡在两个极端上
一个极端是Siri和Alexa这种:非要你喊名字才醒过来,喊完还只能听一句,讲完就睡着了。你要接着聊,得再喊一次。整个体验像是在指挥一只反应迟钝的宠物。
另一个极端是ChatGPT的语音模式(Voice Mode):一旦你进入对话,它就假设你说的每一句话都是对着它说的。这时候如果你旁边坐着一个人,那个人问你"要不要喝咖啡",你回一句"好啊",ChatGPT立马就懵了,可能会顺着这句"好啊"继续给你讲一段咖啡因的化学结构。
两种模式各有各的别扭。一种是太冷漠,你必须反复叫它;另一种是太黏人,你身边发生的任何声音它都要插一嘴。有没有第三种可能?
Toothless要解决的,是addressee detection这个老难题
addressee detection(受话人识别)这个词听起来陌生,但问题本身特别日常:一句话说出口,到底是说给谁听的?
在语言学里,这个问题被讨论了几十年。1979年社会语言学家Allan Bell提出过一个"受众设计"(audience design)理论,说人在讲话的时候会自动调整语气、用词、语速来匹配听众是谁。人类在做这件事的时候几乎不用思考,但机器要做同样的判断,需要综合处理声学信号、语义内容、对话历史、场景上下文一大堆变量。
Toothless的做法是让Jev同时判断好几个维度:这句话是不是在延续之前跟AI聊过的话题;这句话有没有需要联网或者调用工具才能回答的性质;这句话的语气和句式像不像在对机器讲话。多个维度的判断合起来,得出一个概率结论。
关键差异:Jev跑得够快,所以这事儿才成立
同类型的语音AI里,比如OpenAI的Realtime API、Google的Gemini Live,都能做语音对话,但它们的核心问题是:每一句话都要走一趟大模型推理,成本高、延迟大,做不到"永远在听、随时判断"的状态。
Jev不一样的地方在于速度和成本。根据Diogo Almeida公开披露的数据,Jev声称比同类模型快20到200倍,训练效率高40到400倍,用的是一种叫RLCD(Reinforcement Learning from Contrastive Distillation)的训练方法。速度快意味着可以把一个小分类器塞进本地设备,一直开着,每一句话都过一遍,判断"这句话是给我听的吗"。
这个"本地一直开着"是关键差异。用OpenAI Realtime API做同样的事,你需要把每一句话都传到云端跑一遍,一个月的账单可能就够买一辆二手车。用Jev本地跑分类器,只有当分类器判断"这句话确实是对我说的",才会触发一次大模型调用。省钱是一方面,更重要的是隐私!
隐私这件事,被本地分类器彻底改写
你有没有想过一个问题:一个"永远在听"的AI,它到底把你说的话传到哪儿去了?
Alexa在2019年被曝光过一件事:亚马逊雇了一批员工,专门听Alexa录到的用户对话,用来做模型训练。这事儿在Bloomberg被报道出来之后,全球用户炸了锅。类似的丑闻苹果、谷歌都出过。原因很简单:一旦语音助手是"云端处理",你说的每句话本质上都是别人服务器上的一段音频文件。
如果分类器能在本地跑,事情就完全变了。你的房间里发生的对话,绝大部分永远不会离开你的设备。只有当本地的Jev判断"这句话是在跟我说话,而且需要联网才能回答",才会有一个精简版的请求被发出去。日常的家庭闲聊、同事讨论、你自己嘟囔的抱怨,全都留在本地。
这不是宣传口号,这是架构层面的隔离。用Siri你没法自己检查它到底传了什么走,用本地Jev你可以关掉网络看它还能干什么。
但是,事情没那么简单
理论听起来很美,实际做起来卡在一堆细节上。
第一个坎是语音转文字(Speech-to-Text,缩写STT)。Toothless目前用的是一个免费的转录工具,转录质量一般,连人名都会漏识别十几次。要做成产品级别,需要接上更好的STT引擎,比如Whisper或者Deepgram,这一步就会把"本地免费"的美梦打破一半。
第二个坎叫说话人分离(speaker diarization)。房间里有三个人在讲话,机器不仅要判断"这句话是不是给我听的",还要判断"这句话是谁说的"。如果分不清说话人,那么就算判断出"这句话是对AI说的",也不知道该用谁的身份、谁的偏好来回答。pyannote这类开源工具能做,但准确率在嘈杂环境里会掉得很惨。
第三个坎是停顿检测(pause detection)。人说话的时候中间会停顿,停顿一秒是在思考,停顿三秒可能是说完了,停顿五秒可能是被打断了。机器要在这些停顿里做判断,需要极低的延迟。Jev的速度优势在这里派上用场,但是不是真的够低,还得等真实的产品跑出来才知道。
分类器判断错了怎么办?两种错误的代价完全不一样
假设Toothless的分类器准确率能达到95%,听起来很高对吧?但是要拆开看两种错误。
第一种错误叫假阳性:你明明在跟朋友讲话,机器却以为你在跟它讲话,然后插嘴回答了一句莫名其妙的话。这种错误的代价是尴尬,是打断,是让你觉得这个AI"太黏人"。
第二种错误叫假阴性:你明明在跟AI讲话,机器却以为你在自言自语或者跟别人聊天,没有反应。这种错误的代价是你要重复一遍,或者干脆掉头喊唤醒词,等于回到了Siri的老路上。
这两种错误的用户容忍度是完全不对称的。人对"被打断"的反感远远大于对"被忽略"的反感,因为被忽略你还可以再试一次,被打断则会让你觉得整个设备很烦。所以Toothless这类系统在调参的时候,一定会把假阳性率压得非常低,宁可漏判,不可错答。但漏判多了,用户又会觉得"这玩意儿不好使",于是回去按按钮。
环境AI这个概念,被炒了十年还没落地
ambient AI(环境智能/环境AI)这个词,最早可以追溯到1988年施乐帕克研究中心Mark Weiser提出的"ubiquitous computing"(普适计算)。想法是让计算能力像空气一样融入环境,不需要你主动去用,它就在那儿默默帮你。
三十多年过去了,ambient AI依然主要停留在概念层面。真实世界里最接近这个概念的产品是Amazon Echo系列和Google Nest,但你会发现它们的实际使用场景非常窄:定时器、天气、放歌、开灯。原因就是前面说的addressee detection问题没解决,机器听不懂你什么时候在跟它说话,所以只能靠唤醒词做一刀切。
Toothless这类尝试的意义,在于把ambient AI从"关键词触发"变成"意图触发"。你不需要记住任何咒语,你只需要正常说话,机器会自己判断该不该接话。听起来简单,但过去十年OpenAI、Google、Meta都没能大规模做出来这件事,卡的就是速度和成本。
Jev的技术路线,跟主流大模型走的是两条路
现在主流的语音AI,比如GPT-4o、Gemini 2.0,都是"大而全"的路线:一个巨型模型处理所有事情,从听懂你说什么,到判断你想干什么,到生成回复,全都在一个模型里跑完。
Jev走的是另一条路。RLCD训练方法的核心是让小模型学会大模型的判断能力,通过对比蒸馏让小模型在特定任务上跑出接近大模型的效果,但速度快几十倍到几百倍。这条路的思路不是"让一个模型无所不能",而是"让一堆小模型各司其职"。
Toothless就是这个思路的一个具体应用:用一个专门训练来做addressee detection的小分类器,只干这一件事,跑得飞快,跑得便宜,跑在本地。真正需要智能回答的时候,才把请求丢给大模型。这种"小模型做守门员,大模型做专家"的架构,如果真的能跑通,会对现有的语音AI产品形态产生冲击。
类似的思路,已经有人在别的场景验证过
Anthropic在2024年提出过一个概念叫"Haiku作为路由器":用最便宜、最快的Claude Haiku模型先判断用户问题的性质,简单问题直接由Haiku回答,复杂问题再转给Opus。这套架构的经济学非常直接:把90%的请求用便宜模型处理掉,只把10%的复杂请求交给贵模型。
Toothless在做的事情本质上是一样的:本地Jev是路由器,判断"这句话该不该往下走",只有极少数被判定为"确实在跟我说话"的输入,才会触发昂贵的大模型调用。区别是Anthropic的路由是在云端做的,Toothless的路由是在本地做的。
本地路由的好处不仅是省钱和隐私,还有一个隐藏优势:断网也能用。你在飞机上、在地下室、在没信号的地方,本地分类器依然能判断你什么时候在跟机器说话,然后把请求排队,等联网之后再发出去。这种"离线优先,联网增强"的模式,是云端方案永远做不到的。
三条你可以立刻带走的判断
第一:如果你在评估一个语音AI产品,别只看它能回答什么问题,先看它怎么判断"你在不在跟它说话",判断机制在云端还是在本地,是靠唤醒词还是靠意图分类;这一步的架构决定了后面所有的用户体验和隐私边界。
第二:如果你在做AI产品设计,别迷信"一个大模型解决所有问题"这条路,考虑把任务拆成"小模型做守门员,大模型做专家"的分层架构;速度和成本的优势会直接转化成用户能感受到的产品体验。
第三:如果你在意隐私,从今天开始就问所有语音产品一个问题:你的分类器跑在哪里?如果答案是"云端",那么你说的每一句话本质上都在别人服务器上留过痕;如果答案是"本地",那么至少还有一层架构上的保护。
Toothless的开发者说会尽快把代码开源出来,让大家自己去跑一跑。现在还没看到仓库,也没看到独立第三方测试过它的实际准确率到底是多少。这个"本地分类器"的美好承诺,究竟能不能扛住真实厨房里三个人同时讲话加一台洗碗机噪音的考验,答案还没揭晓。