一个令人惊艳的开源项目,解决你的客服 AI 难题!

当前客服场景中频繁出现的“转人工”诉求激提升级了系统决策压力,传统大模型易出现判断偏差,导致用户不满与投诉。行业普遍通过生成JSON文本处理复杂判断,但存在效率低下、成本高昂、结果不确定等痛点,难以适配企业高并发需求。基于此,企业AI技术团队推出以“系统一”为核心的决策模型,如ZooWork推出的Instinct系列,通过结构化概率输出替代传统写作文式决策,将模型聚焦于快速、精准的候选判断,显著降低人工介入成本。该模型支持本地部署,兼具高响应速度与多场景适用性,为企业客服优化提供了可行方案,有望推动AI在复杂判断场景实现高效落地与价值提升。

--91likeyou---

先来说说这个场景的痛点,

“转人工!转人工!转人工!”

我相信各位都说话这样的话。。大概也是客服机器人听到最多的一句话。

很多人以为,机器人挨骂是因为不会说话。但随着大模型发展,早已把话说得足够好了。

让用户崩溃的,往往是它判断错了。

用户说“耳机用了两天,左耳就没声了”,机器人回复“签收已超 7 天,不支持无理由退货”。可按规则,15 天内的质量问题本该直接换货。

用户第三次追问“到底什么时候发货”,语气已经在冒火,机器人还在礼貌地重复物流模板。

话说得再漂亮,判断错一次,就是一次投诉。

一轮普通的客服对话背后,系统要做十几次这样的判断。而目前行业里最常见的做法是:每做一次判断,就让大模型写一段 JSON。

这相当于让一位作家,用写作文的方式来答选择题。

刚才说的 Jev 这种思路正在硅谷走红:不让模型“写”答案,只让它给出每个选项的概率。Instinct 系列决策模型也是为了解决这个问题,由企业 AI 平台 ZooWork 近期推出,在客服场景中的落地尝试。

01 为啥在 AI 客服场景中,判断很重要?

把一个成熟的客服系统拆开看,每一轮对话背后通常都有十几到几十个判断点。

用户想查物流、退换货、改地址、开发票,还是投诉?签收超过 7 天的商品能不能退,这位用户是否满足补偿条件?情绪到了什么程度,有没有提到“曝光”“起诉”?该让机器人继续,转给售后专员,还是升级给主管?刚才那句客服回复有没有越权承诺?下一步该查订单、发优惠券,还是建工单?

这些判断有一个共同点:答案来自一个有限的选项集合。

它其实只需要在几个选项里选一个,并且说清楚:有多确定。

就这么一件事,在过去两年,行业里最常见的做法是:写一段提示词,让大模型输出 JSON,再解析结果。

能用。但一进生产环境,三个扎心问题就会反复出现。

(ps.相信做过企业客服落地场景的小伙伴都能感同身受。。)

第一,慢,而且贵。客服是高并发场景,一轮对话十几个判断,每个都要逐字生成一段文本,延迟和成本层层叠加。用户在等,账单在涨。

第二,飘。格式偶尔出错,选出一个根本不在候选里的答案,同样的输入跑两次结果不一样。每一种情况,工程师都得写一段兜底代码。

第三,也是最致命的:它不知道自己有多确定。

让大模型“顺便报一个置信度”,它多半会自信地报出 0.9 以上的数字——答对时是这样,答错时也是这样,对齐训练带来的过度自信,都会让这个数字失真。

而企业真正需要的,恰恰是这个数字。

九成把握的退款判断可以自动放行,六成把握的必须交给人工复核。

没有可信的概率,就没法设阈值;没法设阈值,自动化就只能永远停留在“辅助”。

02 从 Jev 到 Instinct,让模型专门做判断

决策模型换了一种思路:不生成文本,直接回答一个结构化问题。

输入是三样东西:当前的对话状态,判断问题(业务规则就写在问题里),候选答案。输出只有一样:每个候选答案的概率。

还是开头那副耳机:

系统拿到的就是一组可以直接写进业务逻辑的数字。

再跟大家聊聊,为什么说这个决策模型就比较适合客服场景呢?

任务定义本身成了输入。同一个模型,这一次判断情绪,下一次执行退款规则,再下一次选择工具,不需要为每个任务单独训练一个分类器。规则改了,改的是一段文字,不必重新标注数据、重新训练。

一次计算,给出全部答案。不用逐字生成,一次前向计算就能得到所有候选的概率;同一段对话上的多个问题还可以共享计算,一次跑完。

诺贝尔经济学奖得主丹尼尔·卡尼曼在《思考,快与慢》中,把人的思维分为两套系统:系统一快速、凭直觉、几乎不费力;系统二缓慢、审慎、依赖推理。

一位资深客服一眼看出“这单该换货”“这位用户快要投诉了”,靠的多半是系统一。

这个心理学概念,最近成了硅谷 AI 圈的热词。

9 月 15 日,旧金山的 TypeSafe AI 结束两年隐身,宣布完成 4000 万美元种子轮融资,并发布首个“系统一模型”Jev。公司创始人是前 OpenAI 研究员、InstructGPT(ChatGPT 的技术前身)论文作者之一。Jev 不生成文本,只输出带置信度的决策;TypeSafe 宣称,在同类任务上,它比前沿大模型最多快近 200 倍、便宜 400 多倍。

发布后短短数周,Jev 已被 Vercel、OpenRouter 等平台接入,LangChain 推出了配套集成,开发者社区也出现了专门的开源评测 jevbench。

用不同的模型做工作流里不同的事,正在从一个观点变成一种架构。

热度之外,企业更关心的是落地:模型能不能部署在自己的环境里,懂不懂自己的业务。

ZooWork 给出的答案是Instinct(直觉)

Jev 目前通过托管 API 提供服务;Instinct 则同时提供两种方式:既有稳定的托管 API,价格低于 Jev,也开源了Instinct-4B 模型权重,支持企业本地部署,入口如下:

开源项目地址:github.com/SerendipityOneInc/instinct

模型HuggingFace:huggingface.co/srpone/instinct-tuned-4b

在场景上,Instinct 直接瞄准客服这类需要海量、快速决策的企业业务。

而且扒了一下这个团队的信息,ZooWork 核心团队成员来自谷歌、阿里巴巴、字节跳动等头部科技公司,在 AI 算法、模型训练与推理优化方面积累深厚。之前团队开源的时尚图文检索模型 ZooClaw-FashionSigLIP2,在全部评测中均达到同类开源模型的最佳水平,效果超过月下载量超 40 万次的明星模型 Marqo-FashionSigLIP,贼猛。。

据 ZooWork 介绍,Instinct 目前有两种参数规模、三条模型方案。

  • Instinct Dual 4B面向成本敏感、响应频繁的判断环节。它以 Qwen3.5-4B 为基础,分别计算两个候选项顺序,再合并判断结果;两个顺序可并行执行。意图分流、工单路由、工具选择等任务,可以从这条轻量方案开始。
  • Instinct Tuned 4B是经过决策任务后训练和概率校准的 4B 方案,以单顺序完成判断,在模型体量、效果与调用价格之间取得平衡。规则判定、工单分类、情绪分级等日常决策,是它重点面向的应用方向,也适合作为企业进一步做场景适配的起点。
  • Instinct 27B以 Qwen3.8-27B 为基础,采用单顺序候选得分读出,并对服务链路做了激进的性能优化。在三款方案的现有公开题自测中,它的正确率最高,可优先用于条款较多、上下文较复杂的规则判断,以及更看重判断质量的质检和复核环节。上述是选型方向,具体效果仍需用企业自己的业务样本验证。
  • 来看看实力吧,先看同一批公开题。在 JevBench 历史公开的 231 道决策题上,Instinct 27B 答对 202 道,后训练的 Tuned 4B 答对 198 道;Jev 1.13.0 的公开逐题记录为 200 道。两者分别比 Jev 多 2 道、少 2 道,显示了这两条方案在该公开题集上的竞争力。

    全集结果呈现了更完整的取舍:Jev 的整体决策质量仍领先;Instinct Dual 4B 的校准分与 Jev 接近,但不能将校准分等同于答对能力。两款已测 Instinct 的官方原始 P50 约为 253–260 ms,Jev 为 616.5 ms,说明低时延是它们值得关注的一项特征。

    综合分还取决于怎样计价。当前官方为两款 Instinct 采用基模参考价格估算成本,并将原始延迟乘以 2,作为 demo 服务承载生产负载的假设;Jev 使用其标准公开价,延迟不乘该系数。因此,官方综合分不能直接代表按 Instinct 当前标价购买服务时的性价比。

    不过,ZooWork 方面更看重的,是这些判断如何进入真实的客服流程。通用基准只能证明模型“会判断”,证明不了它“懂客服”。

    客服数据有自己的脾气:口语化,错别字多,一句话里夹着好几个诉求,情绪表达很含蓄,业务规则里全是例外条款。而客服流程里的许多关键动作,恰好可以拆成边界明确的判断:属于哪类诉求、是否满足退换条件、应该调用哪个工具、是否需要转人工。

    Instinct 的结构化选择与概率输出,适合嵌入这些需要反复、快速执行的决策环节。

    ZooWork 将客服作为 Instinct 的重点落地方向,围绕意图、规则判定、情绪、路由、质检和工具选择做场景适配。企业可以把自己的业务规则和必要上下文交给模型,也可以以后训练的 4B 方案为起点,进一步适配企业样本。

    实际接入时,先用历史工单验证,再以影子模式观察,把达到业务要求的判断交给模型,不确定的情况转给人工。

    Ps. 这里展示的是通用决策评测,客服专项效果将以相应业务评测为准。

    03 焚决:判断交给 AI,企业怎样才能放心?

    那么在客服系统里,决策模型最适合先切入以下五类场景?

    CASE 01 智能分流。

    用户第一句话进来,由 2B 这样的小模型判断意图和紧急程度,决定进入哪个处理流程。这是调用量最大的环节,小模型的延迟和成本优势最明显。

    CASE 02 售后规则判定。

    把退换货、补偿、价保等规则直接写进问题里,由模型判断当前情况属于哪一类。规则更新时只需修改文字,不必重新训练。

    CASE 03 情绪与升级预警。

    实时判断用户情绪和投诉风险,高风险对话自动提升优先级、转给资深客服,避免小问题拖成大投诉。

    CASE 04 全量质检。

    过去质检只能抽检几个百分点的对话,现在可以对每一轮回复做合规判断:是否使用了禁用话术,是否做出了越权承诺,是否遗漏了必要告知。

    CASE 05 Agent 的下一步动作。

    在客服 Agent 里,“下一步调用哪个工具”本身就是一道选择题。由决策模型选定动作,再交给生成模型组织语言。

    决策模型的价值,最终落在一件事上:它给出的概率可不可信。

    模型说有九成把握的时候,它应该真的有九成是对的。这叫“校准”。

    校准做好了,自动化才能分层:高置信,直接执行;中置信,执行,同时进入抽检队列;低置信,交给人。

    阈值怎么设,取决于判断错了代价有多大。发一张五元优惠券,和批一笔大额退款,显然不该用同一把尺子。

    这也是不少客服 AI 项目卡住的地方:测试集上的平均准确率很好看,但没人敢让它自动批退款,因为没人知道它哪一次是在猜。

    对此,ZooWork 方面表示:

    “准确率决定模型能不能用,校准决定企业敢不敢用。”

    ZooWork 的建议是:不要只看模型在测试集上的平均准确率,而要在自己的业务数据上检验概率是否可信,并在上线后持续监控。客服数据会随着大促、新品和政策调整而漂移,今天校准良好的模型,三个月后可能就需要重新调整。

    当然,决策模型也不是万能的,很多问题它不做,比如写回复、查数据、开放性题目,这些回答不了,我们要想清楚这三条边界,决策模型才能放在正确的位置上。

    对于想尝试决策模型的企业,ZooWork 也给出了他们的建议。

    第一步,把判断点写成问题。梳理现有客服流程里的每一个判断节点,按调用量和出错代价排序;再把每个节点写成“问题 + 候选答案”,业务规则用自然语言写进问题里。

    第二步,选好规格,影子模式跑一遍。高并发分流用 0.5B,常规判定用 4B,复杂规则和质检用 27B。先与现有系统并行运行,只记录、不执行,对比结果,检查概率分布是否可信。

    第三步,分层上线,闭环迭代。先把高置信、低风险的判断交给模型自动执行,再逐步扩大范围;人工复核的结果回流为训练和校准数据,让模型越用越准。

    04 结语

    之前有很多客户在好奇整个 AI 客服系统的搭建和思路,今天正好借着这个开源项目给大家分享一下~

    过往的情况下,AI 客服会把话说得更漂亮,但是整个执行过程会非常缓慢。

    但现在,决策模型把每一个判断,变成一次快速、可度量、可设阈值的调用。

    做选择题,就别让大模型写作文。

    正在推进客服自动化的团队,可以通过 ZooWork 申请试用,用自己的数据试一试。截至 2026 年 9 月 29 日,官网显示 Instinct 处于免费预览阶段,尚未启用计费,同时已公布以下单价:

    模型 每百万输入 token 的公布价格 27B:instinct 0.03 美元 4B:instinct-dual-4b、instinct-tuned-4b 0.01 美元

    所有型号均不收取输出 token 费用。

    希望自行部署和评估的开发者,也可以从Hugging Face 上的 Instinct-4B 模型和GitHub 项目仓库入手,用自己的业务数据检验效果。

    作者:甲木 公众号:甲木未来派

    题图来自 unsplash,基于CC0协议

    🔥 热词:#一个令人惊艳的开源项目,解决你的客服 ai 难题的方法 · #github上的ai开源项目人机 · #AI开源项目盘点 · #免费的开源项目 · #开源项目的集成网站是什么 · #github的知名开源项目 · #基于flask的开源项目 · #微服务开源项目