框架选择不应只看发布速度或功能勾选表。对已有系统,升级是否破坏工具、会话和审批流程往往比新增能力更重要;对新系统,能否用最少组件满足恢复、权限与部署要求更值得优先验证。

本文保留 LearnAgent 原文来源,并将年中清单更新为 2026-10-03 的核验记录。版本号只是当日公开包索引快照,不代表已在本文完成兼容性测试。

本次核对的 Python 包版本

包 核验到的版本 对应发布日期 使用时的注意点
openai-agents 0.23.1 2026-10-02 不凭主版本数字推断功能稳定性;阅读升级说明
langgraph 1.2.12 2026-09-21 区分 OSS 包、持久化后端及托管服务
ag2 1.1.1 2026-09-29 新 API 与 AG2 Classic 分开评估
semantic-kernel 1.44.1 2026-08-06 与 Microsoft Agent Framework 是不同产品和版本线
google-adk 2.11.0 2026-10-02 会话兼容与 Agent API 变更应分别测试

来源:OpenAI Agents、LangGraph、AG2、Semantic Kernel、Google ADK。安装时应固定选定版本和依赖锁;不要用本文日期保证未来安装仍得到同一依赖树。

按约束缩小候选

主要约束 可以进入试用的候选 必须验证的代价
希望明确控制模型工具循环和交接 OpenAI Agents SDK 等轻量代码 SDK 业务状态、部署、授权仍需应用负责
长流程需要暂停、恢复和持久状态 LangGraph、Microsoft Agent Framework、ADK 的相应工作流能力 状态后端、重放、幂等和升级后的数据兼容
现有 Microsoft 技术栈 Microsoft Agent Framework,必要时保留现有 SK 所依赖 SK 能力是否已有迁移路径
已有 AG2 Classic 应用 先维护固定 Classic 环境,再单独评估 AG2 1.x 工具包装、编排、持久化和测试改造
需要多语言 分别核对 OpenAI、ADK、MAF 的目标语言 SDK 不同语言的功能、发布阶段与依赖差异

这不是排他名单。Microsoft Agent Framework 已有工作流和 A2A 相关能力,ADK 也有自己的工作流机制,不能继续用“只有 LangGraph 能做图式审批”或“只有 ADK 支持 A2A”作判断。MAF 1.0、ADK 2.2.0 版本说明

模型可替换不等于能力无差别

OpenAI Agents SDK 自早期即提供兼容其他模型 provider 的路径,并非到某个年中版本才突然解除模型限制。当前接入范围需要结合适配器和具体模型看,不能把 provider 数量当作完全互换的保证。最初发布说明、模型接口

试换模型时至少核对:工具并行调用、结构化输出、usage 字段、追踪、上下文限制及错误处理。兼容请求格式,只说明入口可用;应用质量和行为仍需回归测试。

SandboxAgent 的隔离边界

OpenAI SDK 的 SandboxAgent 及其运行客户端已经有官方说明,但名称中的 sandbox 不能替代实际隔离。官方本地 Unix 客户端在 Linux 上不额外提供操作系统级隔离;本地方式更适合可信开发,或运行在已经建立安全边界的外部环境中。Sandbox clients

面对不可信命令或文件,应评估正确配置的 Docker 或托管执行环境,检查挂载路径、继承的环境变量、凭据、出站网络和资源上限。不要为了让示例成功,把生产主目录或全量凭据映射进去。

三类迁移风险

AG2 Classic 的旧应用通常使用 autogen 命名空间;新 AG2 1.x 采用新的 Agent、Network 等 API。两者不是改一条 import 就能无损迁移的同一接口。旧应用先锁定实际可运行的版本,再以真实工具与历史任务验证升级。AG2 当前说明、0.13.3 历史说明

ADK 的会话格式兼容与 Agent API/event model 变化也要分开。官方某版本说明给出的特定兼容下限,不能扩写成“整个 1.x 数据都不兼容”。迁移测试要包含真实旧会话的读取、继续执行和写回,而不是只跑新建会话。ADK 2.2.0

微软说明 Semantic Kernel 将在 MAF GA 后至少支持一年,并在仍有大量使用者时继续支持相关维护。MAF 1.0 于 2026-04-03 GA;由此得到的是支持承诺下限,不是 2027 年 4 月停服公告。迁移仍应逐项确认功能,而不是假设 SK 的全部能力已经等价转移。SK 与 MAF 关系、MAF GA

一个可复查的决策流程

先列不能妥协的条件:目标语言、网络与数据地区、模型供应商、审批、恢复和预算。选两到三个候选,使用相同的工具接口与测试集,固定版本后运行正常、超时、拒绝、重复执行和恢复路径。

记录每个候选需要补建的组件、升级工作量及观察到的限制。没有通过硬性条件的候选先淘汰;其余再按维护成本和团队熟悉度选择。不将 star 数、版本号或主观“高成熟度”评分当作可靠性证明。