返回列表

当 Demo 结束,AI智能体才真正开始

ai-insights2026-07-2416 min read
当 Demo 结束,AI智能体才真正开始

作者:王林Lincoln | MindsLeap创始人 | Founders Space合伙人 | 企业家AI俱乐部创始人

“最难的部分,是让它可靠地行动”

Harrison Chase 在这场 LangChain 分享里,一开始就把问题讲得很直白。

过去一年,很多组织已经学会了怎样把 AI智能体 ship 出去。真正拉开差距的,不是第一版谁做得更漂亮,而是谁能更早上线,然后用一套系统的方法持续迭代。

他说:

“构建和发布 AI智能体最难的部分,是让它们可靠地行动。”

这句话值得认真咀嚼。

因为它意味着,AI智能体的竞争正在换阶段。第一阶段是演示:让模型调用工具、打开网页、写一段代码、完成一个看起来惊艳的任务。第二阶段是生产:同一个 AI智能体要面对一百个、一千个,甚至上百万个真实用户和真实业务场景。

在第一阶段,惊喜最重要。

在第二阶段,可靠性最重要。

Harrison Chase 是 LangChain 的联合创始人兼 CEO。LangChain 过去几年几乎参与了 AI 应用开发范式的核心演化:从链式调用,到工具使用,再到 LangGraph、LangSmith 和 AI智能体开发体系。他这次讲的不是某个新功能,而是一套更底层的判断:企业不能再把 AI智能体当成一次性项目,而要把它当成一种需要工程化运营的新型员工。

框架不是答案,透明度才是答案

Harrison 先从 build 讲起。

做 AI智能体,当然可以用框架。框架的价值很清楚:把模型输入、模型输出、工具、提示词、检索这些能力抽象出来,让团队更快上手。

但他也讲了一个 LangChain 早期的教训。

他们曾经有一个 chain,在底层偷偷做了五次 LLM 调用。用户问:“为什么这个 chain 比直接调用 OpenAI 慢五倍?”答案很简单:因为框架在下面做了五次调用,但用户并不知道。

这不是一个小 bug,而是一个信号。

当 AI 应用进入生产,开发者最怕的不是复杂,而是复杂被隐藏起来。一个业务负责人看到的是“这个 AI智能体很慢”;一个工程师看到的可能是“五次模型调用、三次工具调用、两段上下文拼接”。如果中间没有透明的 tracing,没有清楚的结构,问题就会变成黑箱。

所以 Harrison 对框架的态度很微妙:框架有价值,但不能把真实发生的事情遮住。

这对企业尤其重要。很多公司引入 AI 工具时,第一反应是找一个“大而全”的平台,希望平台把所有复杂度都包起来。但 AI智能体不是传统 SaaS。它每一次执行都可能根据上下文、工具、权限和用户反馈走出不同路径。你看不见它的路径,就无法管理它的质量。

不是写代码,而是在定义一个工作系统

真正有意思的是,Harrison 说,AI智能体的定义正在变得越来越不像代码。

提示词可以是 Markdown 文件。工具连接可以是 MCP 配置。skills 可以是一组说明文档和脚本。很多时候,一个 AI智能体的“岗位说明书”,正在从代码仓库里长出来。

这句话背后的变化很大。

过去企业做软件,是把流程写进系统。现在企业做 AI智能体,更像是在给一个会行动的系统定义边界:它该读什么文件,可以调用什么工具,什么时候需要人批准,遇到什么情况要停下来。

Harrison 提到了一类更高层的东西:harness。很多 coding agents 本质上就是 harness。它们不只是调用模型,而是管理上下文、文件系统、人类介入、子智能体、skills,以及长时间任务中的状态。

这让我想到一个企业里常见的误区:大家以为 AI智能体就是“一个模型加几个工具”。但 Harrison 讲的其实是另一件事:AI智能体是一套工作系统。

如果你把它当工具,它只能回答问题。

如果你把它当工作系统,它才可能承担流程。

测试 AI智能体,比测试模型更像测试一个人

到了 test 部分,Harrison 把差异讲得更清楚。

他说,测试普通 LLM 应用比较简单,本质上是在循环里调用模型。你可能要考虑限速,但整体不复杂。

AI智能体不一样。

“测试 AI智能体时,每个智能体可能会跑十五分钟、三十分钟。它不只是回答,它还会产生 artifacts,还会和环境交互。”

这句话很关键。

传统软件测试,很多时候是输入一个值,检查一个输出。AI智能体测试,更像是让一个员工完成一件事,然后看他有没有真的把事情办成。

Harrison 举了 coding agent benchmark 的例子。你不能只看它改了哪些文件,而要跑单元测试,验证结果是否成立。这就是 criteria-based judging:不是看过程漂不漂亮,而是看成果过不过关。

但更麻烦的是,真实业务里的 AI智能体经常没有标准答案。

一个客服 AI智能体是否处理得体?一个销售 AI智能体是否推进了机会?一个运营 AI智能体是否找到了异常?这些问题不能只靠 ground truth。它们需要数据集、边界案例、评估标准,也需要业务专家参与定义什么叫“做得好”。

这也是为什么我一直认为,AI 转型不是买模型,而是重构组织能力。企业真正缺的,不是会写 prompt 的人,而是能把业务判断转化为 eval 标准的人。

部署之后,问题才开始变真实

Harrison 讲 deploy 时,列出的不是“如何上线”,而是一串真实世界的问题。

如果 AI智能体跑到一半失败了,能不能从断点恢复,还是必须从头再来?

它有没有短期记忆和长期记忆?

它返回给用户的应该只是 token,还是也包括思考过程、工具调用和执行状态?

人类审批怎样嵌入流程?

如果 AI智能体自己写代码并执行,这些不可信代码该放在哪里跑?

这些问题听起来很工程,但本质上是管理问题。

一个 AI智能体只在本地 demo 里跑一次,你可以假装这些都不存在。可一旦它开始接入 Notion、CRM、工单系统、财务系统,开始代表员工或组织调用工具,它就不再是聊天机器人,而是拥有局部行动权的数字员工。

Harrison 提到,人类介入在本地很容易,在生产环境大规模运行时很难。怎么暂停 AI智能体,等人批准,再继续执行?哪些工具必须审批?哪些动作可以自动做?

这正是企业 AI 落地的分水岭。

真正成熟的 AI 原生组织,不是让 AI 什么都自动干,而是非常清楚地知道:哪些地方必须自动,哪些地方必须暂停,哪些地方必须留下审计记录。

你看不见轨迹,就无法治理 AI智能体

Harrison 在 monitoring 部分说了一句很朴素的话:监控就是告诉你,AI智能体到底做了什么。

最基础的东西是 tracing。

“这可能是你在进入生产之前就应该设置好的最基本的东西。”

它要记录 AI智能体走过的每一步:每一步的输入是什么,输出是什么,调用了哪些工具,子智能体做了什么,LLM 看到的上下文是什么。

这不是为了好看,而是为了调试。

Harrison 说,大多数 AI智能体出错,是因为 LLM 没有拿到正确的上下文。所以你能不能看见它当时到底看见了什么,就变成了排查问题的核心。

再往后,是从成千上万条 traces 里找出真正值得看的问题。用户点赞、差评、反馈,甚至用户说“你搞错了”“你应该做 X 而不是 Y”,都可以成为信号。LangChain 把这类东西叫 perceived error:从人与 AI智能体的交互痕迹里判断它是否犯错。

这件事对企业非常重要。

因为未来管理 AI智能体,不可能靠老板每天打开十条聊天记录人工检查。你需要仪表盘,需要在线评估,需要能自动聚类问题的机制。否则 AI智能体越多,组织越失控。

治理不是最后一步,而是包住整个生命周期

最后 Harrison 讲 govern。

很多人会以为治理是上线之后的合规动作。但在他的框架里,治理不是一个独立阶段,而是包住 build、test、deploy、monitor 的整个生命周期。

成本控制是一部分。LangChain 自己内部也在大量使用 coding agents,Harrison 说成本已经变得有点失控,所以他们需要看见成本,也要管理成本。

工具权限是另一部分。

“当 AI智能体使用 Notion 时,它是代表我、代表同事,还是代表一个服务账号?”

这句话一下子把问题从技术拉回了组织。

AI智能体调用工具,不只是 API 权限问题,而是责任归属问题。谁授权?谁承担后果?谁能审计?哪些工具调用必须 human in the loop?哪些上下文和 skills 可以被共享?

企业一旦真正部署 AI智能体,这些问题都会变成日常管理问题。

所以这场分享真正有价值的地方,不是告诉我们 LangChain 又做了什么产品,而是给出了一个判断:AI智能体的生产化,正在逼企业重新发明一套软件工程和组织治理的混合体系。

写在最后:从“能做”到“能管”

很多企业今天还停留在第一层问题:AI智能体能不能帮我写报告、查资料、跑流程?

Harrison Chase 这场分享提醒我们,真正的问题已经往前走了一步:当 AI智能体真的开始工作,你能不能持续改进它?能不能测试它?能不能看见它做了什么?能不能在关键动作前让人介入?能不能控制成本、权限和审计?

这就是从 demo 到生产的距离。

Demo 证明的是模型能力。

生产考验的是组织能力。

对中国企业家来说,这可能是今年最值得认真理解的一条分界线:AI智能体不是一个“上线即可”的工具,而是一种新的组织单元。它需要岗位说明书,需要试用期,需要绩效评估,需要权限边界,也需要被不断训练和复盘。

未来企业之间的差距,不只是有没有 AI智能体,而是谁能把 AI智能体纳入自己的管理系统。

当 demo 结束,真正的工作才刚刚开始。


关于 MindsLeap 心智悦动

MindsLeap 心智悦动是 AI原生组织转型加速平台。

我们与硅谷创新孵化器 Founders Space 深度合作,持续连接全球 AI 前沿认知、硅谷科技创业生态与中国企业家的真实转型场景。

围绕 AI 原生组织建设,MindsLeap 正在构建一个面向企业家、创业者、AI 工程师、产业专家和投资人的转型生态,帮助企业把 AI 从认知、战略和工具,真正落到组织能力、业务流程、产品创新和增长系统中。

返回列表
王林Lincoln · 2026-07-24