先说一个最近常碰到的场面。一家几十人的公司,销售用 AI 写方案,客服挂着问答机器人,行政用另一套工具做周报。三件工具各自都不便宜,可同一个客户在三个软件里的名字、阶段、金额都不一样,一份报价单要来回复制 3 遍。
老板给这件事的总结只有一句:工具装上了,活反而更乱了。多数人以为这是工具没配好,其实是岗位职责从来没写清楚,真正的卡点不在会议室里,而在几个工具之间对不上的数据上。
三个工具各干各的,人成了中间的翻译

乱的地方很具体。销售让 AI 写方案,客服让 AI 答疑,两边口径对不上,客户前后听到两套说法。出了问题要复盘,才发现没人说得清是哪一步错了。3 个系统里的同一个客户,名字、阶段、金额各写各的。
工具没有选错。同一批模型,换一种组织方式,结果可以完全不同。这句判断不是我们说的,是 NeurIPS 2025 收录的一项研究给出的。
那项研究覆盖 7 个主流多智能体框架、1600 多条标注轨迹,多智能体系统的失败率落在 41% 到 86.7% 之间。数字不低,但更值得看的是根因拆解。
失败的大头不在模型,在结构
据 Cemri 等 2025 年发表在 NeurIPS 的那份研究,失败根因分三类。44.2% 来自系统设计,32.3% 来自智能体之间的失配,23.5% 才是任务验证没通过。接近一半的失败,跟模型聪不聪明没关系。
失败的根子不在模型笨,而在结构没设计。据 Heydari 等 2025 年的预印本研究,独立型多智能体架构把错误放大 17.2 倍。中心化协调则把它限制在 4.4 倍。
同样是 2025 年的预印本研究测得,出了事之后自动归因并不准。识别责任智能体的准确率只有 53.5%,定位失败步骤的准确率只有 14.2%。等出了事再查,查不动。
多数人以为多智能体是技术问题,其实不是。八脉看这件事,第一刀切的不是模型,是责权利。谁在什么时候对什么结果负责,这件事必须在设计阶段写成一份责任清单。
加人加机器都不管用,规模有自己的天花板
还有两条容易踩的坑。Gartner 在 2026 年的十大战略技术趋势报告里给过一个推演。哪怕单个智能体的错误率只有 15%,一个五步流程跑下来,整体失败的概率也会超过一半。
所以 Gartner 的建议是先从编排式设计入手,把错误累积压住,再谈自主和自组织。智能体不是越多越好,一项 ICLR 2025 收录的研究发现,规模在 16 个附近就开始饱和。
堆智能体和组织化是两件事,前者加数量,后者定结构。
制度不是管人的绳子,是把做法从人的记忆里搬出来
据 Cemri 等 2025 年的研究,把标准作业程序编码成协作约束之后,前两类失败下降了 60% 到 68%。同一份研究在 ChatDev 上做了干预实验。收紧角色规范让任务成功率提高 9.4 个百分点,加入高层级验证步骤提高 15.6 个百分点。
制度不是管人的绳子,它是一张写清楚谁跟谁怎么对接的流程图。它的用处不在讲道理,而在把做法从老员工的经验里搬出来,搬进系统。新来的人和智能体,都照同一个做法跑。
这就是我们说的制度驱动协作。制度定不下来,协作就只能靠人盯人,人一多就盯不过来。这也是为什么 2026 年的 Gartner 报告建议先把编排规则写死,再谈自治。
责权利要精密耦合,三个角缺一个都站不住
责权利不是三张表,它落在每个人月底那张考核表上。有责必有权,有权必有责,责权必有利。责大权小,人扛不动;权大利小,人不划算。三条线要一起量,只挂在墙上没有用。
2026 年的一项预印本研究把团队角色、协调机制、问责矩阵做成了可执行配置。但研究者自己的结论是,组织设计无法被硬编码。换一个模型家族,配置就可能翻转,可迁移的不是模板,是 3 类变量的判断方法。
前面那组数据已经说明了为什么责权利急。事后归因识别责任智能体的准确率只有 53.5%。定位失败步骤的准确率只有 14.2%(Zhang 等 2025 年预印本研究)。所以在设计阶段就把责任写成可执行的条目,比事后追责可靠得多。
文化激励这一层,我们只敢说到前沿
文化这件事,多数人以为靠讲,其实靠的是制度管不到的那一小块。沙因在 1985 年提出的文化三层次,赫茨伯格的双因素理论,都是这一路六十多年的积累。
在智能体系统里,这一维度的情况不一样。据 Cemri 等 2025 年的研究,第二类失败智能体间失配占 32.3%。它的子模式包括隐瞒信息、忽略他人输入、未请求澄清,本质上就是非正式规范的缺失。
但以文化和激励设计为自变量、以系统绩效为因变量的受控实证,在我们的检索范围内还没有取到。所以这一层我们写的是在建,没写已验证。反过来看,一份在 2026 年敢标出未取到的材料,比一份处处领先的材料更值得信。
别人交的不是图纸,是一条能跑通的流水线
市场上不缺平台,也不缺模板。把智能体连起来、让它能调用工具,这类能力最近一年进步很快。据公开报道,飞书 CLI 开放的功能点从 2026 年 3 月的 247 个增加到 767 个。钉钉也推出了企业级 AI 原生工作平台。
据 Gartner 预测,到 2026 年 40% 的企业应用会嵌入任务型智能体,在 2025 年这个比例还不到 5%。缺的是另一件事:这个组织该分几个部位、部位之间怎么耦合、什么条件下该收什么变量。
行业里有人把这个问题说得很直白,不重构系统、不创新流程,AI 就只是成本,不是生产力;但说这句话的一方,交付物仍然是平台件,不是那条流水线。这句话点到了要害,只是它自己没往前再走一步。


八脉组织自动化运营系统©交的是另一件东西:一条能跑起来的组织流水线。八脉看的是 8 个部位之间的耦合关系。别人交的不是图纸,是一条已经跑通的流水线;我们交付的是零件怎么摆、谁跟谁对接、出了问题按哪条线追。
真要开始,先走这四段

八脉把这件事拆成四段。顺序不能乱:先工具,再责权匹配,然后制度,最后系统。前一段是后一段的地基,反过来工具不被前面的规则框住,就是一堆散件。
第一段·工具。把现在在用的每个 AI 工具列一份清单。清单只填 3 个字段,口径只有一条:它替谁干活、输出给谁用、出错了谁认。3 个字段填不满的,就是还没组织起来的工具。
第二段·责权匹配。按 3个部位×5个环节×2道闸 的口径,给每个工具、每个环节配齐责任、权力、利益三条线。只写一条的,后面一定返工。
第三段·制度。把前面的责权编码成一张写清楚谁跟谁怎么对接的流程图——也就是协作约束和 SOP。制度不是管人的绳子,是把做法从老员工的经验里搬出来,搬进系统。新来的人和智能体,都照同一个做法跑。
第四段·系统。把前三段串成一条能自动跑的组织流水线。八脉组织自动化运营系统©交的就是这件东西:零件怎么摆、谁跟谁对接、出了问题按哪条线追。
先跑一个月,只记录不考核
这四段不是写完就交差。四段共用的强制验证节奏是:先按现状跑满 1 个月,只记录、不考核。这 1 个月里只沉淀事实——哪个环节卡、谁还在中间传话、数据对不对得上——不做绩效扣分、不追责。1 个月后回看,哪些环节还是靠人在中间传话,那些就是接下来要补的地方。
这套顺序只解决结构问题,不能替你判断业务方向。它给不出增长答案,也给不出行业判断,它只把谁跟谁怎么配合这件事说清楚。
多久能看到变化
老板最常问的一句是,这套东西多久能见效。前 1 个月你看到的是哪些环节在空转。第 3 个月你看到的是返工次数有没有降下来。
结构不动,每一年都要为同一类失败再付一次成本。据公开媒体报道转引,MarketsandMarkets 数据显示全球智能体市场 2026 年约 193.3 亿美元。这个数字预计在 2033 年达到 2058.8 亿美元,复合年增长率 40.2%。
据公开媒体报道转引,QuestMobile 数据显示,2026 年 7 月 AI 效率办公赛道月活跃用户 1.02 亿。总使用次数同比增长 112.4%。工具已经在人手上,问题留在了组织里。
组织先于智能
国务院 2025 年 8 月印发的《关于深入实施“人工智能+”行动的意见》提出,到 2027 年智能体等应用普及率要超过 70%。到 2030 年要超过 90%。企业落地 AI,第一步不是买模型,是先画一张流程图。
这张图要写清谁跟谁对接、出了问题按哪条线追、谁在什么时候对什么结果负责。这张图画不清楚,买多少模型都只是成本。
这一轮工具的热闹会过去,留下来的还是分工、制度、责权利和文化这些老问题。只不过现在要一起为人和智能体设计一遍。
数据与出处
引用凭据见下。Cemri 等 2025 年 NeurIPS 研究,DOI 10.52202/085713-4082。Heydari 等 2025 年预印本研究,arXiv 2512.08296。Zhang 等 2025 年预印本研究,arXiv 2505.00212。Chen 等 2026 年预印本研究,arXiv 2607.25446。Qian 等 2025 年研究见 ICLR 2025。Gartner 2026 年趋势报告。国务院 2025 年 8 月行动意见。网信办等部门《智能体规范应用与创新发展实施意见》。市场规模与月活数据来自 MarketsandMarkets、QuestMobile,经媒体转引。
声明
加企业微信【灵机书院】,领免费八大测评工具,用数据看清企业八个部位哪根筋没长好;完整方法论看官网 6mhr.com
本文由 AI 辅助起草,经艾博老师审定。作者:艾博老师 | 北京六脉企业管理咨询 · 灵机书院®