企业 AI 应用落地,不能只靠一个大模型

在企业中,AI 的应用至关重要。本文将探讨企业 AI 应用的三个关键层次:Agent、Skill 和 Harness,以及它们如何协同工作以实现有效的业务自动化。

--91likeyou---

这两年,很多企业都在问同一个问题:

我们是不是也应该做一个 AI 应用?

每次听到这个问题,我通常不会马上谈模型或平台。我会先跟着业务人员把工作走一遍:哪一段还停留在纸上,哪一段只是重复录入,哪一段需要人的判断,哪一段出了错必须有人负责。

如果一上来就问“用哪个大模型”“接哪个 Agent 平台”“要不要做智能体”,很容易把问题带偏。

企业应用的难点,本来就不只在模型会不会回答。

难点在于:

一张纸质单怎么变成线上数据?

一个部门填完的数据,怎么可靠同步到另一个部门?

一个字段改了以后,哪些公式、报表、审批、权限会受影响?

AI 给了建议以后,谁来确认?系统能不能留下记录?出了错能不能追溯?

项目最后往往就卡在这些地方。

做过几类项目之后,我用现在最前沿的技术可以从这三层看企业 AI 应用:

第一层是 Agent。它让 AI 不只是回答问题,而是能围绕一个目标持续推进任务。

第二层是 Skill。它把企业里的流程、规则、经验、模板沉淀下来,让 AI 不必每次从零猜。

第三层是 Harness。它让 AI 在真实业务里可控运行:知道什么时候能自动做,什么时候必须停下来问人,失败以后怎么处理。

这三个词听起来有些技术味,放进真实业务里就容易理解了。

先用一张表压一下:

图 1:Agent 把任务往前推,Skill 提供做事方法,Harness 管住边界和质量。

这里先记住分工就够了:执行、经验和控制,需要分别设计,不能都压在模型身上。

一、先别急着上模型,排程项目让我先补了数字化底座

我做过一个制造企业的生产排程管理 MVP。

客户的生管部门每天要处理大量生产单。订单信息在 Excel 里,生产进度在纸质单上,变更信息在。生管排程表是一张 150 多列的大表,里面有订单、客户、产品、交期、备料、投产、成型、涂装、贴标、装配、包装、出货等信息。

这张表不是普通表格。

它是整个生产链条的业务中枢。

销售要靠它答复客户交期,车间要靠它安排生产,仓库要靠它备料,管理层要靠它看进度。任何一个数据录错,都可能影响后续一整串动作。

原来的工作方式有几个很具体的麻烦:

  • 每天几十到上百张生产单,要人工录入。
  • 纸质单据流转慢,现场反馈经常滞后。
  • Excel 宏经常出错,出了问题还要反复核对。
  • 一旦客户要求提前交期,或者车间反馈某个制程变化,生管人员就要重新计算后续制程,还要通知相关部门。

那次项目里,我没有直接上一个“AI 排程 Agent”。原因很简单:数据还没完整上线,流程也没有闭环,模型再聪明也接不住。

我们先把生产排程这件事拆开:

  • 哪些数据来自订单导入?
  • 哪些数据来自车间每日生产反馈?
  • 哪些单据需要审核后才能生效?
  • 哪些字段可以用公式自动计算?
  • 哪些异常需要提醒相关人员?
  • 哪些信息应该进入管理仪表盘?

最后我们用的是“一表一流程一仪表盘”的方式。

一表,是生管排程大表,作为统一数据源。

一流程,是各类线上表单和工作流,比如每日实际生产表、返修表、报废表、拆批表、制程变更表。

一仪表盘,是订单状态、生产进度、产能利用、交期风险等指标的实时看板。

这里面用了 AI,但项目的骨架仍然是业务流程。

  • 公式负责确定性计算,比如制程时间、物料需求、周期推算。
  • 工作流负责自动同步,比如表单提交后更新主表,审核通过后再生效。
  • 权限负责控制边界,比如不同部门看到不同字段,关键操作需要审批。
  • AI 字段则放在更适合它的位置,比如交期风险预测、异常订单分析、变更影响说明。

这个项目让我更确定了一个判断:

不是所有地方都要用大模型。确定性的事情交给公式和流程,需要判断、预测、解释的地方再交给 AI。

图 2:先把分散在纸质单、Excel 和,再谈自动化和 AI。

二、Agent 的价值,是把任务往前推进

很多人一听到 Agent,就会想到“智能体”“AI 助手”“自动干活”。

这些说法都没错,但容易让人误解。

在企业应用里,我更看重它能不能围绕一个目标,把任务一步步往前推。

比如数据分析场景。

业务人员上传一个 Excel,希望快速生成一份分析报告。如果只是普通聊天机器人,它可能会告诉你“你可以从销售额、地区、品类几个维度分析”。这当然有帮助,但它没有真正把事情做完。

一个更接近 Agent 的方式,是把任务拆成几个角色:

  • 总控 Agent 先接收任务,判断用户想做什么。
  • 文档解析 Agent 专门负责读取 Excel,把表头、字段、数据类型和原始记录整理成结构化 JSON。
  • 数据分析 Agent 再根据数据结构设计分析维度,生成统计结论、图表和报告。
  • 最后总控 Agent 汇总结果,交付给用户。

这已经不是简单的“一问一答”,而是一条任务链。

用户只需要表达目标:帮我分析这份销售数据。

系统内部要完成一串动作:接收文件、解析数据、清洗格式、判断字段、设计维度、生成图表、写报告、返回结果。

Agent 的价值就在这里:它接过的不只是一个问题,而是一项需要持续推进的工作。

图 3:Agent 的重点不是一次回答,而是围绕目标持续观察、计划、行动和修正。

但这里也要注意:Agent 越能干,风险也越大。

如果它只是回答一句话,错了也只是文本错。

如果它能读文件、调用工具、生成报告、更新系统,错了就可能影响真实业务。

所以企业里做 Agent,不能只问它“能不能做”,还要问:

  • 它做到哪一步需要检查?
  • 它是否理解自己的职责边界?
  • 它能不能把中间结果交出来?
  • 它失败时会不会乱编一个结果?

而它每一步该怎么做,不能全靠临场发挥。这就到了第二层:Skill。

三、Skill 要沉淀的,是企业里的做事经验

企业里最值钱的东西,很多时候不是某一段代码,而是经验。

  • 一个有经验的生管人员,看一眼制程变更,就知道可能影响哪些订单。
  • 一个有经验的财务人员,看到发票字段缺失,就知道哪些地方要人工复核。
  • 一个有经验的数据分析师,拿到一份销售表,就知道先看时间趋势,再看区域差异,再看品类贡献。

这些经验如果只存在人的脑子里,就很难复制。

今天这个人状态好,能问得很细;明天赶时间,就可能漏掉边界。

今天这个分析师知道怎么做,换一个业务人员就不知道。

Skill 要做的,是把这些经验整理成 AI 可以按需调用的能力包。它不只是一段提示词。

我现在判断一个 Skill 是否有用,会看它有没有说清四件事:

  • 什么时候用它。
  • 用了以后按什么步骤做。
  • 需要读取哪些规则、模板、脚本或知识。
  • 哪些事情不能做,做到哪里必须停。
  • 还是用发票提取这个场景举例。

    企业财务或采购部门每天会收到各种发票,有图片,有 PDF,有扫描件。用户希望一键上传多份文件,系统自动提取发票代码、号码、日期、购销方、金额、税额、明细等字段,最后输出统一表格。

    如果只是让大模型“帮我识别发票”,结果会很不稳定。

    • 图片和 PDF 的处理方式不一样。
    • 多文件需要循环处理。
    • 不同路径的结果需要合并。
    • 重复发票要去重。
    • 金额、税额、日期、税号要校验。
    • 缺失字段不能编,应该返回空值或标记待确认。

    这些规则如果每次都靠临场提示,很容易漏。

    更好的做法是把它做成一套能力流程:

    • 上传文件后,先判断文件类型。
    • 图片走视觉识别,PDF 走文件提取。
    • 两条路径都转成统一文本。
    • 再用同一套字段抽取规则输出 JSON。
    • 最后用代码节点合并、去重、校验、统计。

    把流程、字段规范、输出模板和校验规则固定下来,发票提取才从一次任务变成了一项可以复用的能力。

    以后类似场景再出现,比如合同提取、采购单识别、质检单录入、报销单审核,就不需要从零设计。

    只要替换字段和业务规则,底层方法是可以复用的。

    所以我常说:

    Skill 解决的不是“让 AI 更会说”,而是让 AI 更知道在某个业务里应该怎么做。

    四、Harness 是企业 AI 落地里最容易被低估的一层

    如果说 Agent 解决“谁来做”,Skill 解决“怎么做”,那 Harness 解决的是“怎么可靠地做”。

    这个词不太好翻译。

    我更愿意把它解释成:围绕 AI 运行的一整套管理机制。

    就像一个新人进入公司,不能只给他一本员工手册就让他自由发挥。

    你还需要任务清单、权限规则、审批流程、检查机制、异常处理、复盘记录。

    放到 AI 上,道理没变。

    尤其在企业应用里,Harness 至少要回答几个问题:

    第一,任务现在走到哪一步了?

    第二,当前这一步需要看哪些资料,不需要看哪些资料?

    第三,哪些操作可以自动做,哪些操作必须人工确认?

    第四,失败以后是重试、降级、停止,还是转人工?

    第五,完成以后凭什么证明真的完成?

    回到生产排程案例。

    当车间提交一张返修表时,系统不能直接无条件更新主表。

    因为返修信息会影响订单进度、物料损耗、交期判断,甚至影响后续统计。

    所以更稳妥的机制是:

    • 表单提交后,先进入审核。
    • 审核通过后,才自动更新生管排程总表。
    • 更新后,通知相关人员。
    • 如果影响交期,再生成风险提醒。
    • 如果字段异常,流程应该停下来,而不是继续往后跑。

    系统里未必会出现 Harness 这个名字,但这套机制不能缺。

    图 4:Harness 可以理解成 AI 应用的运行制度:任务状态、上下文、权限、检查、失败恢复都在这里。

    再看发票提取。

    大模型可以抽字段,但不能相信它一次性输出的结果一定正确。

    所以要有校验:

    • 发票代码和号码是否存在?
    • 金额与税额、价税合计是否能对上?
    • 日期格式是否合法?
    • 同一张发票是否重复上传?
    • 抽取失败时,是重试,还是标记为人工复核?

    这些都不是“模型能力”,而是系统能力。

    很多 AI Demo 看起来很惊艳,就是因为它只展示最顺利的一条路径。

    但企业落地不是演示。

    真实业务里一定会有脏数据、错文件、权限限制、字段缺失、流程中断、用户误操作。

    能不能处理这些不完美,才决定系统能不能用。

    做过几次这类项目后,我的判断变得很具体:

    企业 AI 应用真正的分界线,不是能不能生成答案,而是有没有 Harness 把答案接住。

    五、先做分工,再谈全自动

    做企业 AI 落地时,我最怕听到一句话:

    这个场景能不能全自动?

    这个问题当然可以问,只是不能跳过中间过程。

    很多业务场景第一步需要的不是全自动,而是先把流程搬到线上,把数据统一起来,把责任边界说清楚。

    在生产排程项目里,把纸质单变成线上表单,把 Excel 宏换成可维护的表格公式,把人工同步改成工作流更新,再让管理人员从仪表盘查看进度,这些改造已经解决了不少实际问题。

    AI 字段只是其中一部分。

    它更适合放在需要推理、判断、预测和解释的地方。

    • 确定性计算,用公式。
    • 流程流转,用工作流。
    • 权限控制,用组织权限和审批。
    • 数据展示,用仪表盘。
    • 复杂判断,再用大模型。

    这样安排,AI 才能用在更值得用的地方。

    企业客户最后看的,还是能不能节省时间、减少错误、留下记录,并且持续用下去。

    因此,一个完整的企业 AI 方案通常会同时用到几种能力:

    • 业务梳理负责找到真问题。
    • 数字化负责把数据和流程接起来。
    • 自动化负责减少重复操作。
    • Agent 负责推进复杂任务。
    • Skill 负责复用业务经验。
    • Harness 负责控制风险和质量。

    缺了前面的业务梳理和数字化底座,后面的 Agent、Skill、Harness 很容易变成悬在流程外面的功能。

    六、我会怎么判断一个企业场景适不适合做 AI

    在咨询和落地前,我通常会先看四件事。

    第一,看业务价值。

    这个问题是不是高频?是不是痛?解决以后能不能明显节省时间、降低错误、提升响应速度?

    如果只是偶尔发生,或者解决后价值很小,就不一定值得做成 AI 应用。

    第二,看数据和流程基础。

    数据在哪里?是不是结构化?质量怎么样?流程有没有固定节点?有没有人负责确认?

    如果数据散在纸上、群里、个人电脑里,第一步可能不是大模型,而是数据治理和流程线上化。

    第三,看 AI 是否真的适合。

    如果是确定性计算,公式更可靠。

    如果是规则明确的审批,工作流更可靠。

    如果是需要理解自然语言、处理非结构化材料、做复杂判断或生成解释,AI 才更合适。

    第四,看风险是否可控。

    AI 的输出会不会影响资金、合同、生产、客户、合规?

    如果会,就必须有人工确认、日志、权限、回滚、复核机制。

    这四个问题问完,很多场景就清楚了。

    • 有些适合做完整 Agent。
    • 有些适合做工作流加 AI 节点。
    • 有些只需要智能表格和自动化。
    • 还有一些,现在根本不该做。

    我的判断是:

    企业 AI 落地不是把所有业务都 AI 化,而是找到最适合 AI 介入的位置。

    图 5:价值高、数据和流程接得住、AI 确实适合、风险也可控,这类场景才值得优先投入。

    七、放进企业应用后,这三层各自做什么

    现在再看 Agent、Skill、Harness,就不抽象了。

    Agent 像一个能推进任务的执行者。

    它适合处理目标明确、路径不完全固定、需要多步完成的任务。比如上传 Excel 后生成分析报告,或者根据业务问题检索知识库、判断意图、生成回复。

    Skill 像一本可执行的业务手册。

    它把企业里的知识、流程、规则、模板、校验方法整理成结构化能力。比如发票字段抽取规则、数据分析报告模板、生产异常判断逻辑、客服知识分流策略。

    Harness 像一套运行管理制度。

    它决定 Agent 能不能稳定地进入真实业务。比如任务状态、权限边界、人工确认、失败重试、输出校验、日志审计、结果复核。

    三者合起来,企业 AI 应用才有机会从一次性的 Demo,变成可以使用、管理和持续优化的业务系统。

    图 6:Skill 解决“知道怎么做”,Harness 解决“必须按这个方式做”。两者配合,Agent 才不容易自由发挥到失控。

    我用一句更通俗的话总结:

    Agent 让 AI 会办事,Skill 让 AI 按经验办事,Harness 让 AI 办事不乱来。

    八、写在最后:把 AI 做成一项业务能力

    Agent、Skill、Harness 是这两年经常出现的新词,放到企业里,处理的还是几类老问题:

    • 谁来做事?
    • 按什么方法做?
    • 出了问题谁负责?
    • 怎么证明做对了?

    只不过过去这些问题主要由人、流程和系统来解决。现在,大模型进入了业务系统,我们需要重新设计这套分工。

    模型很重要,但模型不是全部。

    • 一个没有业务流程的 AI 应用,很难落地。
    • 一个没有经验沉淀的 Agent,每次都像临时工。
    • 一个没有 Harness 的自动化系统,越能干越危险。

    对我来说,企业 AI 应用的方向也因此很清楚:接入模型只是开始,后面还要重新整理流程、经验和控制机制。

    • 从一个纸质单线上化开始也可以。
    • 从一个发票提取流程开始也可以。
    • 从一个数据分析 Agent 开始也可以。

    第一步不必看起来多高级。更重要的是,它有没有进入真实业务、解决具体问题,并留下可以复用的经验和可控的运行机制。

    这才是我理解的企业 AI 应用落地:不是把 AI 包装得更像一个人,而是让它进入工作现场,成为一项可靠的业务能力。

    题图来自作者提供

    🔥 热词:#企业 ai 应用落地,不能只靠一个大模型吗 · #ai在企业中的应用 · #企业ai平台如何搭建 · #ai的企业 · #2020年,企业应该让ai扮演哪些角色? · #企业应该如何利用ai技术 · #企业ai是什么 · #企业ai设计都包括什么