我用 6 个 AI Bot 搭了一个虚拟团队——Hermes 多 Bot 编排实战
一个 Hermes 实例跑 6 个 Bot,每个专注一个领域——股票分析、教育内容、代码评审、文字润色、深度调研、综合协调。这篇记录我怎么从「一个万能 Bot」进化到「一支虚拟团队」,踩了哪些坑,以及为什么 Profile-as-Bot 比你想的更简单。 1. 缘起:一个万能 Bot 的疲惫我的 Hermes Agent 一开始只有一个 default profile。它要管股票分析、要写教案、要审代码、要润色文章、要做调研——什么都干,什么都不精。 问题逐渐暴露: 上下文膨胀:60+ 个技能全部塞进一个 Bot 的上下文,每次对话 token 消耗巨大 角色混乱:让它分析股票时它想写教案,让它审代码时它想做调研 Cron 冲突:所有定时任务共用一个 profile,盘前简报和教案巡检互相干扰 记忆污染:股票分析的对话历史和教育内容的对话历史混在一起 我需要的不是一个万能 Bot,而是一支各司其职的团队。 2. 核心架构:Profile = BotHermes 的 Bot Mode 本质上是一个 UI 层——底层原语就是 Profile。每个 Profil...
给自己的 AI 家教做了一次安全审计——6 个 P0/P1 漏洞的发现与修复实录
我给自己的 AI 家教系统(灵犀学堂)做了一次全面审计,结果发现:API 密钥明文裸奔、付费内容可免费白嫖、3 个用户共用同一个激活码、23 个临时脚本堆在根目录。这篇记录我怎么一步步发现问题、定位根因、逐个修复——以及为什么 AI 产品的安全审计比传统软件更难做。 1. 缘起:你的 AI 产品真的安全吗?做 AI 产品的人很容易陷入一个误区:功能跑通了 = 产品没问题。 我的灵犀学堂(Education Agent)上线两个月,学生端能聊天、能做题、能看教案,遗忘曲线引擎每天自动提醒复习——看起来一切正常。直到 8 月 16 号,我决定给自己做一次全面审计。 为什么突然想到要审计?因为我在清理项目根目录时,发现了一堆一次性的 Python 脚本——fix_01a.py、cleanup_all_misplaced_objectives.py、batch_review_all.py……这些脚本是之前调试时临时写的,一直堆在那里没人管。我开始好奇:如果连脚本都没清理,其他地方是不是也有隐患? 于是我写了一个审计计划,从 6 个维度对整个系统做了一次体检。结果——每...
QGS 质量门禁:我踩了46次刹车,换来的质量提升值不值?
我在 Hermes Agent 里装了 QGS(Quality Gate System)质量门禁——一个会在每次复杂任务输出前自动评分的系统。运行了10天,46次被阻断,102次人工审批点。这篇用真实数据复盘:它值不值得装?踩了多少坑?以及什么情况下 QGS 反而会拖后腿。 1. 缘起:为什么要在 Agent 里装刹车去年我写了一篇 QGS 质量门禁系统:给 AI Agent 装上”刹车和质检”,介绍了 QGS 的设计理念——在 Agent 输出前加一道质量评分闸门,分数低于阈值就阻断输出。 当时只是一个实验性的想法,跑的是简单任务。 这一个月,我把 QGS 接进了生产环境——每天 20+ 个 cron 任务、多模型并发、跨项目协作,复杂度远超当年。 10 天下来,审计日志里记录了 373 次评分、46 次阻断、102 次人工审批点。数据不会说谎——我们来聊聊值不值。 2. 生产环境数据:46 次刹车背后的故事先上硬数据。QGS 的所有决策都写入 ~/.hermes/qgs/audit_wal.jsonl(append-only JSONL),我从中提取了以下统计: 整...
学生 8 天没练,掌握度从 83% 归零:我给 AI 家教装了遗忘曲线引擎
我给自己做的 AI 家教(灵犀学堂)加了个”自我改进引擎”。第一次 cron 运行就甩了我一巴掌:10 项补习调度,9 项是遗忘风险——一个学生 8 天没练,掌握度从 83% 直接归零。这篇记录我怎么把艾宾浩斯遗忘曲线从心理学课本搬进代码:一个公式、一套稳定性动力学、三条自动管线,以及四个真实踩坑。 1. 缘起:AI 家教凭什么知道学生”其实已经忘了”?做教育 Agent 之前,我以为自适应学习就是”记录学生答对答错,算出掌握度”。直到我给系统加了一个每天自动运行的自我改进引擎(AutoCalibrator / AutoRemediator / AutoStrategyTuner 三管线),第一次跑出来的报告让我意识到一个致命问题: 1234[遗忘提醒] yadinae | gk_it_02 遗忘风险: gk_it_02 (原始 80% → 有效 0%, 衰减 100%)[遗忘提醒] demo_student_001 | ch01 遗忘风险: ch01 (原始 62% → 有效 0%, 衰减 100%) 原始掌握度 80%,有效掌握度 0%...
我的 Agent 一出生就是落后产品:从 1416 次 tick 到 PrimeAgent 基座重写
上周我写了一篇《我的 Agent 假装上班了 5 天》,诊断了自研 ActiveAgent 的”空转”。这周我做了个更狠的决定:亲手杀掉它,推倒重写。 原因是一句话——“agent 技术发展日新月异,大概率 AA 一出生就是个落后产品。” 这篇记录从「要不要继续做」的灵魂拷问,到 AA v2 四层架构、QGS 三 Gate 时机设计、6 轮对抗式评审收敛的全过程。 1. 缘起:一个让我失眠的问题我的 ActiveAgent(AA)是一个”自治运维壳”:每 15 分钟 tick 一次,扫描 3 个项目 × 9 个维度,发现问题就修复,每天 21:00 出日报。上周刚把它”假装上班 5 天”的空转问题修好(见《我的 Agent 假装上班了 5 天:自主系统「空转」诊断实录》)。 修完之后,我盯着它问了自己一个问题:AA 还有必要继续发展吗? 把账算清楚之后,答案让我睡不着: 数据 数值 含义 tick 次数 1416 次 系统自认为”工作”的总次数 其中只 report 的 98% 几乎全部只是汇报,没有行动 skills 只有声明无实现 宣称的能力是空...
Cloudflare Wallet 全景综述:AI 智能体的钱包、身份证与 Agent 电商基建
2026 年 8 月 4 日,Cloudflare 发布 Cloudflare Wallets 与 cloudflare.pay:给部署在 Cloudflare 上的 AI 智能体一个稳定身份,以及一套”在人类设定的限额内安全花钱”的能力。这意味着 agentic commerce(智能体商务)的买方基建终于有了第一块正式拼图。本文基于官方博客、新闻稿与多家第三方报道,梳理这条产品线的来龙去脉:它解决什么痛点、架构长什么样、底层 x402 协议如何让 HTTP 402 复活、当前能做什么、还缺什么。 1. 缘起:AI 智能体的”付款困境”先看一个真实场景。你的 AI 智能体想试用一个新 API(比如某个模型服务、某个数据源),它需要做什么? 打开一个为人类设计的登录页面; 等一个人类过来添加支付方式; 生成 API key; 最后才搞清楚怎么调用这个 API。 这个流程对智能体来说几乎走不通,原因有两个: 没有稳定身份:智能体没有一个持久的标识符去注册服务,一个人类可以瞬间开出几十个智能体,商户根本不知道在和谁打交道; 没有原生支付手段:智能体没法填信用卡,也没法...
让 AI Agent 在雪球自动发股评:从阿里云 WAF 攻防到数据零幻觉的完整实录
我维护的 stock MCP Server 有上百个工具——实时行情、K线、龙虎榜、北向资金、涨停梯队……但某天我意识到:这些数据只喂给了自己,没有变成”作品”。于是花了 72 小时,给 Agent 接上一条「收盘后自动写市场综述并发到雪球」的管线。本文完整记录:6 大平台选型、阿里云 WAF 攻防(curl_cffi 全指纹被拦 → Playwright 页面内 fetch 穿透)、三个接口逆向坑,以及”LLM 写财经文数字必漂移”的数据零幻觉方案。第一篇文章已真实上线。 1. 缘起:一堆好工具,却没发挥出价值我有一套股票分析系统:一个 stock MCP Server(通过 Cloudflare Workers 网关暴露上百个工具),加上每天 11:00 的盘中简报、16:10 的收盘深度分析。数据链路非常完整——开盘、收盘、资金流向、涨停梯队,全部自动化。 但有一天我看着这些日报,突然问了自己一个问题: 这些分析只发给了我自己。它们能不能变成对外发布的作品? 网络上正好有专门的股票社区——雪球、东方财富、掘金。能不能让 Agent 每天收盘后,用 MCP 拉数...
我的 Agent 假装上班了 5 天:自主系统「空转」诊断实录
每天 21:00 准点发报告、每 15 分钟执行一次”工作循环”——我的自主 Agent 看起来忙得不可开交。但有人问了一句:”怎么每次报告的内容都差不多?” 一查之下发现:它从 7/27 起就在空转,5 天产出了零。 这篇记录完整的 8 处断链诊断与修复过程,附可直接抄的检查清单。 1. 缘起:一个让人起疑的问题我搭了一套名为 ActiveAgent 的三向 Agent 互联运行时(连接教育 Agent、股票 MCP 网关和 Hermes),它有两个核心承诺: 每 15 分钟一次 tick:自动扫描 3 个项目 × 9 个维度,发现问题就修复 每天 21:00 报告:汇总当天干了什么、进度如何 某天我翻看连续几天的每日报告,越看越不对劲: “怎么每次报告的内容都差不多呢?教案进度始终只有 1 个评审,自主扫描都是那几个数字。” 直觉告诉我它可能没在正常工作。于是开始排查——这一查,牵出一串**”看起来活着、实际上空转”**的连环断链。 2. 核心方法:8 处断链的定位与修复 第一步:确认”它真的没干活”先看数据全景: 组件 表面状态 实际状态 ...
Graph Engineering 图工程:12 字推文引爆的 AI Agent 新范式,一文讲透
一条 12 字的推文、290 万浏览量、48 小时三种竞争定义、一个根本不存在的”斯坦福研究”——“Graph Engineering”(图工程)成了 2026 年 7 月 AI 圈最热的新词。但它到底是不是又一个炒作?这篇文章给你一份不带滤镜的完整拆解。 1. 缘起:一个 12 字的推文2026 年 7 月 18 日,OpenClaw 作者 Peter Steinberger 在 X 上发了一条 12 字的推文: “Are we still talking loops or did we shift to graphs yet?”(我们还在谈循环吗,还是已经转向图了?) 这条推文获得约 290 万浏览量。48 小时内,”Graph Engineering” 经历了完整的互联网造词周期:出现三种竞争定义、一波跟风文章、以及一个根本不存在的虚假研究——号称”$3.1M 斯坦福与 Anthropic 联合研究”,后被调查确认为捏造的 engagement bait(引流诱饵)。 更戏剧性的是,Steinberger 并没有发明这个词。目前可考的最早严肃使用,是 Josh...
软考高项备考精华:一次读完的高项通关指南
一句话摘要:软考高项(信息系统项目管理师)是以信息化与信息技术为基础、以项目管理十大知识领域为核心、以高级项目管理方法论为延伸的系统化考试,备考关键在于理解信息系统底层逻辑、掌握项目管理过程框架、熟练计算题公式,并通过案例分析与论文写作展现综合管理能力。 1. 考试全景(题型分布、考试形式、备考策略)软考高项考试分为三个科目,需一次性全部通过方可获得证书。 科目一:综合知识(选择题) 75道单选题,考试时间150分钟,满分75分,45分及格。 覆盖信息化与信息技术、项目管理知识体系、高级项目管理、法律法规、标准规范等。 计算题约5-8分,主要考查EVM挣值分析、PERT三点估算、CPM关键路径法、决策树等。 科目二:案例分析(问答题) 3道大题,考试时间90分钟,满分75分,45分及格。 题型包括找错改错、计算题、判断题、填空题等。 常考领域:范围管理、进度管理、成本管理、质量管理、风险管理、配置管理等。 科目三:论文写作 2道论文题选1道,考试时间120分钟,满分75分,45分及格。 要求结合自身项目经验,按照论文框架(摘要+正文)论述某一知识领域的管理过程。 近...









