一条 12 字的推文、290 万浏览量、48 小时三种竞争定义、一个根本不存在的”斯坦福研究”——“Graph Engineering”(图工程)成了 2026 年 7 月 AI 圈最热的新词。但它到底是不是又一个炒作?这篇文章给你一份不带滤镜的完整拆解。


1. 缘起:一个 12 字的推文

2026 年 7 月 18 日,OpenClaw 作者 Peter Steinberger 在 X 上发了一条 12 字的推文:

“Are we still talking loops or did we shift to graphs yet?”
(我们还在谈循环吗,还是已经转向图了?)

这条推文获得约 290 万浏览量。48 小时内,”Graph Engineering” 经历了完整的互联网造词周期:出现三种竞争定义、一波跟风文章、以及一个根本不存在的虚假研究——号称”$3.1M 斯坦福与 Anthropic 联合研究”,后被调查确认为捏造的 engagement bait(引流诱饵)。

更戏剧性的是,Steinberger 并没有发明这个词。目前可考的最早严肃使用,是 Josh C. Simmons 于 7 月 4 日的博客《We Are Entering the Graph Engineering Phase》。Steinberger 的推文本意是嘲讽 AI 圈改名速度,结果点燃了引信。

两天内,LangGraph 作者 Harrison Chase 本人下场回复:

“So i didn’t really know what graph engineering is, and i still don’t really… but it’s basically just langgraph?”

——当参考实现的作者都承认不知道这词指什么新东西时,这个术语的含金量就值得掂量了。

一句话起源总结:这不是一次发布、不是一篇论文,而是一个 builder 在推特上问了一句”我们是不是该换框架了”。真正爆火的不是新能力,是一个命名事件

2. 图工程是什么:三要素 + 与循环的关系

抛开炒作,一个 agent 图(agent graph)只有三个部分:

要素 含义 例子
节点 Nodes 干活的单元。通常是专用 agent(研究员/写手/评审员),或确定性步骤(函数、工具调用) researcherwriterreviewer
边 Edges 路由。直连、条件边、扇出 fan-out、扇入 fan-in if review.pass: ship else: loop_back
共享状态 State 沿边流动的对象,每个节点读写它:任务、草稿、裁决 {"draft": "...", "verdict": "fail"}

状态是把一堆 agent 变成系统的东西——否则只是一群互相忘记的群聊成员。

与循环(loop)的关系,是理解这个术语的关键

  • Loop engineering(循环工程)设计的是单个 agent 重复的周期:规划 → 行动 → 观察 → 验证 → 重试。
  • Graph engineering(图工程)决定几个 loop 如何连接
  • 一个单循环就是最小的图——一个节点带一条回到自身的边。图不是循环的替代品,而是它上面的一层。

@shannholmberg 给出了最锐利的一行判别式:“区别在于谁决定路径——agent 还是你。” 循环里你设定目标和验收标准,agent 自己选路线;图里你声明合法路径和沿途检查点,agent 的自由被限制在节点内部。

传播最广的比喻来自 @rohit4verse:“Agents are graduating from while-loops to org charts”(agent 正从 while 循环毕业到组织架构图)。像公司一样:专门化的角色、定义好的交接、共享的记录、结果向上汇总。

Josh Simmons 的定义最凝练:“Loop engineering 是单个上下文窗口内部的手艺,Graph engineering 是上下文窗口之间的手艺。”

3. 术语谱系:五年爬了五层楼梯

图工程不是凭空出现的,它是 AI 工程”杠杆外移”梯子上的第五级:

时期 工程对象 你的角色
2023 Prompt 提示词 发给模型的请求 操作员
2024 Context 上下文 模型能看到什么 编辑
2025 Harness 马具 模型周围的工具、记忆、脚手架 工具制造者
2026.06 Loop 循环 单 agent 重复的周期 系统设计师
2026.07 Graph 多个 agent/步骤之间的协调 组织设计师

每一级都比上一级抽象一步。Josh Simmons 对此有一句著名观察:“这个最被炒作领域的前沿,正在漂回分布式计算最古老的学科——状态机、幂等性、故障域、背压。而一半刚到这里的人坚信是自己发明的。”

4. 三种含义:同一个词,三个问题

术语爆火 48 小时内就出现了三种互不相让的定义:

  1. 编排图(Orchestration Graphs):把多智能体系统设计为显式图——类型化节点、类型化转换、检查点。这是 LangGraph、Temporal 的领域。这是 2026 年 7 月的主流新含义。
  2. 循环之图(Graphs of Loops):自我改进循环互相监视的网络。最抽象,最不落地。
  3. 图结构知识与记忆(Graph-structured Knowledge & Memory):agent 的知识存储为可遍历的类型化节点和边(知识图谱、GraphRAG、图记忆)。唯一有十年研究、可用工具和真金白银的含义。

关键辨析:知识图谱/GraphRAG ≠ 图工程。AI Builder Club 说得很直白:”知识图谱是把数据建模成实体和关系用于检索;图工程是建模执行——下一个运行哪个 agent、它拿到什么状态。同一个词,无关的问题。” TrueFoundry 补充:”知识图谱结构化系统知道什么;图工程结构化系统是谁——它的成员、授权、消息路径。” 两者可以共存于一个架构,但回答的是不同问题。(Neo4j 等图数据库厂商用的是第三种含义,这是混淆的主要来源。)

5. 先例与框架:这个”新”东西已经存在三年

图工程最扎实的批评是:没有新能力。2026 年 7 月没有任何产品发布是 2025 年做不出来的。先例清单:

  • LangGraph(LangChain):三年前就开始做节点/边/共享状态的图编排,月下载 65M+ 次
  • Microsoft Agent Framework:AutoGen 与 Semantic Kernel 合并(2026 年 4 月 GA)
  • Google ADK:图模型是头号特性,顺序/并行/循环工作流 agent 是一等公民
  • A2A / ACP 协议(2025 年):agent 跨系统委托的标准化协议
  • Temporal / Prefect:durable execution(持久执行)垫在 agent 底下,运行能跨崩溃、重启、周末存活
  • 更早的根系:数据流架构、编译器依赖图、Airflow(十年 DAG)、深度学习计算图、actor 模型、contract-net 协议、org chart/RACI/BPMN
  • Anthropic 2024 年《Building Effective Agents》 已经画过全部模式:chaining、routing、parallelization、orchestrator-workers、evaluator-optimizer——“放白板上任何一张都是图”

学术界也早已落位。arXiv:2604.11378 点破了循环的天花板:“agent loop 是一个就绪集里恰好只有一个单位的调度器”——任何计算领域都会管这叫”一个很聪明但没有操作系统的进程”。该论文调查了 70 个开源 agent 项目,60% 仍在跑纯循环,并把纯循环描述为”你最终会长大的模式”。

LangChain 官方博客承认了一切,同时指出了真正的新东西

“把 agent 系统表示为图不是新想法,我们做了三年。宽松地说,变的不是图,而是节点里能放什么。早期节点是确定性代码或单次 LLM 调用;现在 agent 本身足够可靠了,一个节点可以是完整的一次 agent 运行——你编排的是 agent,而不只是 LLM 调用。”

把 coding agent 嵌进更大的图里作为节点,是 2026 年新可行的模式。

6. 什么时候用图:决策框架

所有诚实资料的第一句话都是:大多数任务永远不需要图。 单任务 + 清晰验证 = 循环,用图是纯开销。决策表:

工作信号 循环就够 需要图
任务形状 单任务、有明确终点 分裂成多个专业角色交接
并行性 步骤顺序执行 需要扇出(同时多个)再汇聚
每步工具/模型 全程相同 每步不同模型或工具集
控制流 agent 可安全自由漫游 需要显式、可审计的角色间路由
失败隔离 坏步骤重试即可 单节点失败不污染其他节点
谁验证 agent 自查循环输出 独立评审节点检查另一节点的产出

Flowtivity 的 2×2 矩阵更直观:简单+低并发=单循环;简单+高并发=并行循环;复杂+低并发=分段循环;复杂+高并发=图工程。经验法则:3 个以上独立验证步骤 + 复杂决策路由 → 用图。

反例(过度工程):”总结这个 PDF”建了 5 节点图(抓取器、切块器、总结器、评审器、格式化器)——“你用组织架构图回了一封邮件”。

LangChain 补充了重要一条:agent 图通常不是 DAG。生产环境需要循环:重试失败的工具调用、向用户要缺失信息、验证后修订、暂停等待人工输入。”Loops are simple graphs”(循环就是有向循环图)。以及动态转换很重要:map-reduce 时节点在运行时决定创建多少工作,而不是静态定义所有边。

什么时候不要用图?真正 agentic 的任务(如深度研究)——强制确定性路径是错误选择,用 agent harness(LangChain 的 Deep Agents);GPT Researcher 也从图管道换成了 Deep Agents。

7. 核心实践:七条原则 + 类型化边

Josh Simmons 的七条实践原则,被多篇后续文章引用:

  1. 先画状态,再写提示词——状态 schema 就是你的架构。写不出系统在每个运行点知道什么,你就只有一个 demo。
  2. 让节点保持无聊——单职责、可独立测试、可缓存、可重试、可替换。一个干五件事的节点是”带多余步骤的循环”。
  3. 把判断力放在边里——图的智能在路由里,model-decided 边是失败高发区,要重点埋点。
  4. 每次跨边都 checkpoint——失败从”重启整个运行”变成”重试单个节点”。这也是长周期任务可行的原因:可以等人类批准三天而不占用上下文窗口。
  5. 把人当作节点——审批应该是一条边进、一条边出、中间一个人,而不是挂在外面的异常处理器。
  6. 把预算放进状态——token、美元、墙钟时间都在状态对象里,在边上强制执行。不能在支出阈值处停住 agent,你就不是在跑自主系统,是在烧钱。
  7. 评估轨迹,而不只是输出——输出评估告诉你运行结束得好;轨迹评估告诉你路径是否 sane、代价是否 sane。

类型化边(Typed Edges)是核心概念:未类型化的边”A 和 B 相关”只携带 1 bit 信息;类型化的边(supersedesdepends_ondecided_bycausedimplementsreferences)才把连接变成可推理的知识。“边的类型就是知识——不是节点。任何系统都能找到两份相关文档,类型化边才能让 agent 回答’为什么变’而不是’和什么相关’。”

一个反直觉的例子:问”为什么我们抛弃了 Redis 做任务队列?” 向量搜索会拉出 10 份提到 Redis 的文档,但答案在结构里——ADR-007 supersedes ADR-003ADR-003 caused Incident-0311,三个独立文档、一条因果链。“向量搜索找到听起来像你问题的东西;图找到与你答案相连的东西。”

Flowtivity 的五阶段落地方法论:AUDIT(盘点现有循环,标出瓶颈)→ IDENTIFY(找独立步骤=并行化候选)→ DESIGN(3-5 个节点起,纸上画图)→ IMPLEMENT(构建并测量墙钟时间和每次成功成本)→ TYPE(加类型化边——最多团队跳过但收益最大的一步)。

实操技巧:graph-max 技术(Alex Kotliarskyi)——画个图(纸上都行),发给 Codex CLI”写一个实现这个工作流的 code mode 脚本并运行”,没有第三步。

8. 数据与基准:真实成绩单

图工程三种含义中,只有知识图谱/图检索方向有硬数据(GraphRAG-Bench,arXiv 2506.05690,独立评测):

图赢的

  • 多跳推理:53.4% vs 42.9%(向量 RAG)
  • 时间推理:图变体 Mem0 58.1 vs 21.7(OpenAI memory,全场最悬殊)
  • 语料级综合:64.4% vs 51.3%

图输的

  • 简单事实查找:向量 60.9% vs 图 60.1%(图加冗余上下文,毫无收益)
  • 成本:GraphRAG 全局搜索单次查询烧 331,375 tokens vs 向量 880 vs HippoRAG 2 的 1,008

两条重要警告

  1. LightRAG 在自己的 benchmark 上报出巨大胜利,独立评测崩到 6.6 平均 F1(vs HippoRAG 2 的 59.8)。永远不要相信只被作者自己评估过的系统。
  2. Mem0 自家论文里,图变体在多跳问题上输给了非图变体。”图是工具,不是宗教。”

项目杀手是实体解析,不是图算法:决定”Dr. John Smith”、”J. Smith”、”John”是一个节点,而”水星行星”和”水星元素”是两个节点。错误随跳数乘法复合:每跳 95% 精度 → 5 跳链 77% 可信;85% → 44%。”你引以为傲的多跳遍历是抛硬币。”人工维护的 wikilink(Obsidian 的 [[ADR-007]])按构造解决了实体解析——这解释了为什么 markdown 知识库方案在 2026 年重新热门。

行业背书:LinkedIn 用图把支持解决时间降 28%;Gartner 预测 2028 年超半数企业 agent 系统使用基于图的上下文。2026 年严肃系统的共识方向:小类型化核心、廉价索引、混合检索、时间性取代(temporal supersession)——“facts expire, not die”(Zep/Graphiti 双时间线模型:旧事实不是被删除,而是有效期被关闭)。

9. 炒作检查:玩笑、垃圾和真东西

  • 批评者:机制完全不新——图编排、状态机、A2A 协议都早于该词一年以上(@RhysSullivan、XState 作者 @DavidKPiano 等)。Harrison Chase 的”basically just langgraph?”最具杀伤力。
  • “玩笑论”(Louis Bouchard):”两条主要推文都是玩笑。Steinberger 在嘲笑改名速度——prompt 变成 context,变成 harness,变成 loop,全都差不多。但玩笑能病毒式传播,是因为它指向了真实且 relatable 的东西。”
  • 最深刻的批评(Carlos Perez):”organised nonsense at industrial scale(工业规模的、组织良好的胡说八道)”——20 个 agent 用同一个模型、读同一份有缺陷的上下文,会工业规模地互相认同(模型倾向于同意自己的输出)。防御手段:评审者用不同模型 + 新鲜上下文 + 外部证据(真实跑过的测试、真到账的钱、留存的客户、人类专家)。
  • 纯粹的垃圾:starmex 式 meme 推文(”一夜蒸发 5 亿美元市值”)和那个不存在的”$3.1M 斯坦福研究”。
  • 中立总结:”标签是可选的吗?是。升级是真实的吗?是。只是别在需要之前就上。”
  • 成本真相:图更快但不一定更便宜。并行审查在通过率高于约 50% 时盈亏平衡;通过率低时,反馈循环(所有评审者失败 → 重写 → 重新分发)可能比顺序循环烧更多 token。要监控”每次成功完成的成本”,不只是墙钟时间。

10. 我们的实践:这套方法论已经在真实系统里跑

写这篇综述时我发现一件事:我们自己的 agent 体系早就在做图工程,只是没这么叫。

  • 对抗式解题法(adversarial-solver):GAN 多轮对抗 + P0-P4 评分收敛,正是图的 evaluator-optimizer 模式,而且内置了 Carlos Perez 警告的防御——多角色独立评审、评分收敛而非互相背书,正好规避”organized nonsense”。
  • DAG 工作流编排:我们之前一直觉得”没有 DagEngine,DAG 规范意义有限”——这与图工程的共识完全一致:拓扑要可执行、状态要可 checkpoint,规范才有意义。
  • 动态模型路由:按节点选模型、按任务类型路由,就是”把判断力放在边上”。
  • 并行子代理(fan-out/fan-in):多路并行派发、结果汇聚,是图的原生操作。

最大的收获是这五条可直接落地的改进

  1. 每次跨边 checkpoint——失败从”重启整个运行”变成”重试单个节点”
  2. 状态 schema 显式化——先画状态再写提示词
  3. 轨迹评估——不只评估输出,还要评估路径是否 sane、代价是否 sane
  4. 预算进状态——token/美元在边上强制执行
  5. 评审者用不同模型 + 外部证据锚定——这是图工程最大的坑的解法

11. 总结:循环没死,被降级了

  • 术语会沉淀,能力早已存在——图工程最好的结局是像 “REST”:先被嘲笑,然后成为默认词汇,最终没人记得它曾经是热词。
  • 真正的范式转移在节点内部——节点从”LLM 调用”变成”完整 agent 运行”,这是 2026 年真实发生的。
  • 循环没死,被降级了——它现在是图的一个节点。”Loop engineering 是单个上下文窗口内部的手艺,Graph engineering 是上下文窗口之间的手艺。”
  • 技能转移:循环工程奖励会跟模型说话的人;图工程奖励懂系统的人。“上一个阶段属于擅长跟单个模型对话的人,这个阶段属于 builder。”

参考来源:Josh C. Simmons《We Are Entering the Graph Engineering Phase》(2026-07-04)、The AI Operator《What Is Graph Engineering? A Field Guide for Builders》、LangChain 官方《3 Years of Graph Engineering with LangGraph》(2026-07-22)、AI Builder Club《Graph Engineering Guide (2026)》、TrueFoundry《Graph Engineering for Multi-Agent Systems》(2026-07-20)、Flowtivity《From Loops to Graphs》(2026-07-25)、What’s AI《Graph Engineering Explained》、GraphRAG-Bench (arXiv:2506.05690)、HippoRAG 2 (arXiv:2502.14802)、Zep/Graphiti (arXiv:2501.13956)、arXiv:2604.11378

注:文中引用数据均标注出处;厂商自报数据(如某些 18% 提升、90% 多智能体优势)未经独立验证,请谨慎引用。