Agent 基础设施的变化,值得从可验证的工程能力看:工具如何接入,任务怎样委派,失败后如何恢复,人怎样审核,以及费用和数据流能否被追踪。本文整理截至 2026-10-03 已可查的进展与采用条件,不用下载量、星标或未经复现的厂商案例替代技术评估。
本文在 LearnAgent 原文基础上修订。协议发布、SDK 发布、托管服务功能和客户案例属于不同类型的信息,下面分别说明。
工具连接与代理委派各有边界
MCP 主要描述客户端如何访问服务器提供的工具、资源等能力;A2A 聚焦代理之间的发现与任务协作。实际系统可以同时使用它们,但并不需要因为“有多个代理”就引入所有协议。
A2A 官方发布记录中,v1.0.0 发布于 2026-03-12,随后有 v1.0.1。其他活动或文章的日期不能替代协议首次稳定版日期。实施时应记录实际协议版本和双方实现,而不是只写“支持 A2A”。A2A 发布记录
当代理跨进程、框架或组织边界,需要明确发现、身份、任务生命周期和结果传递时,可以评估 A2A;同一进程中少量固定步骤,普通函数或框架工作流也可能足够。这个判断取决于边界和协作要求,没有“超过三个代理必须采用”的通用阈值。A2A 官方说明
MCP 传输继续演进
stdio 仍适合本地子进程连接,Streamable HTTP 面向远程场景;旧 HTTP+SSE 传输已弃用,并有兼容说明。不能把“支持 Streamable HTTP”推成 stdio 已被废除。传输规范
2026-07-28 规范与相关 SDK 已调整远程传输的行为。迁移时应逐项核对会话标识、GET/DELETE、重连与恢复规则,不能沿用旧版 HTTP 教程,也不能继续把已经变化的旧 roadmap 当作当前缺失能力。Streamable HTTP、TypeScript SDK
协议互通之外,服务仍需落实认证、授权、网络出口、工具白名单和日志管理。协议本身不会替代业务权限系统。
状态管理成为架构问题
长任务容易遇到超时、服务重启、人审暂停和外部依赖失败。此时需要比较的不是“有没有 memory”一个勾选项,而是状态写在哪里、哪些步骤可重放、外部写入是否幂等、恢复时怎样确认权限仍然有效。
LangGraph 的持久化文档展示 checkpoint 与线程状态机制;这些机制有助于构建恢复流程,但部署者仍要选择存储、备份、保留和隔离策略。磁盘上的 checkpoint 不等于模型上下文,也不自动等于合规审计记录。LangGraph 持久化
评估多代理系统时,应同时比较简单工作流基线。如果增加代理数没有提高成功率,却增加协调、费用和调试成本,就没有必要为结构复杂而复杂。
客户案例需要保留出处与任务范围
Anthropic 的 Fable 5/Mythos 5 发布材料提到 Stripe 的特定大型 Ruby 代码迁移案例。这可以作为厂商披露的客户实践,本文没有独立复现其中的规模、质量或收益,也不据此宣称所有代码库能取得相同效果。Anthropic 发布材料
Stripe 自己的 Minions 工程文章介绍另一组端到端编码代理的设计经验。两份材料可分别阅读,但不能仅因公司相同,就认定前述迁移由同一系统完成。Stripe Minions
同样,Anthropic 趋势报告里 Fountain 的“快 50%”涉及招聘候选人筛选流程,不是软件开发速度。跨行业案例有启发,但需要保留原任务、样本和厂商报告的限定。2026 Agentic Coding Trends Report
生态规模数字应如何阅读
星标、包下载量、注册服务器数和活跃使用者是不同指标。任何精确数量都应附采样日期、仓库或查询范围、去重方式和可复查结果。没有历史快照,就不应拿当前数值反证过去;也不应继续引用无法追溯的旧数字。
例如,MCP 的 issue #1649 是 Server Cards 提案,不能用它证明某日 Registry 收录数量。提案原文。选择框架时,应直接评估 API、维护政策和工作负载,而不是让热度数字成为结论。
团队可以做的六项检查
- 协议:列出工具与代理边界,记录确切版本,做一次真实互通与错误恢复测试
- 状态:强制中断任务后恢复,确认不丢数据,也不重复执行支付、写库或发信等副作用
- 权限:区分模型建议与服务授权,确认人工批准范围在重试后仍然有效
- 可观测性:能追踪一次任务的模型用量、工具调用、失败原因和人为修改,避免记录秘密
- 成本:以成功任务和审查负担衡量,给并发、token、重试和第三方调用设上限
- 可替换性:换模型、存储或工具实现时运行同一评估集,核对功能差异,而不是假设兼容接口完全等价
这些是采用基础设施的检查项目,不是对某个框架的统一排名。适合团队的下一步,通常是拿一项真实任务验证最薄的一套方案,再按失败证据补能力。