← Landscape
9 层结构 持续更新
从底座模型到部署上线 的完整技术栈
开发者搭一个 AI Agent 要经过的完整链条:选哪个底座模型、用什么框架编排、靠什么协议接工具、怎么管理记忆和长上下文、落地成编码助手还是多智能体系统、怎么监控评测、在哪个沙盒里跑代码、最后部署到哪。这张图不追"这周谁发了新模型",追"这一层现在谁在领跑、谁在掉队、格局有没有变"。
最后更新 2026-08-26
当前版本 v1
下次复核 ~2026-09
总览 结构图
9 层大致按"底层→构建→上线"的顺序排布;协议/记忆/可观测性三层是横向贯穿多层的支撑能力,不是严格单向依赖。
底层
01 · 底座模型
Claude / GPT / Gemini · Qwen / DeepSeek / Kimi / GLM / MiniMax
构建层
02 · 编排框架
LangGraph / CrewAI / MS Agent Framework / OpenAI & Claude Agent SDK
03 · 上下文协议
MCP / A2A / AAIF治理
04 · 记忆管理
pgvector / Mem0 / Zep / Letta
08 · 多智能体协作
A2A / CrewAI Flows / subagents
落地形态
05 · 编码 Agent
Claude Code / Cursor / Copilot / Codex / Devin / Replit Agent — 目前最成熟的落地场景
支撑基础设施
06 · 可观测性/评测
07 · 沙盒执行环境
09 · 部署托管
底座模型 → 编排框架 → [协议+记忆] → 落地形态 → [评测+沙盒+部署] 三层支撑基础设施
Agent 的智能核心,决定推理、工具调用、长上下文的能力上限。2026 年最大的变化:中国开源模型在 agentic 跑分上已经追到个位数差距,价格却便宜 5-20 倍 ,月之暗面 Kimi K2.7-Code 是第一个进入 GitHub Copilot 模型选择器的中国开源模型。
Anthropic · 旗舰
100万 token 上下文,自适应思考,面向 agentic/企业场景调优。
Anthropic · 高性价比日常款
Free/Pro 默认模型,SWE-bench Pro 63.2%。
OpenAI · 旗舰家族
三档位:Sol旗舰、Terra均衡、Luna低成本。
Google DeepMind
agentic/多模态主力线,Flash 系列约每3周迭代一次。
阿里 · 国产旗舰
默认100万上下文,驱动阿里"悟空"Agent平台。
深度求索 · MIT协议
压缩稀疏注意力实现100万上下文,3.2万亿+训练token。
月之暗面 · 修改版MIT
1万亿参数MoE(320亿激活),首个进入GitHub Copilot模型选择器的中国开源模型。
智谱/Z.ai · MIT协议
355B/32B激活MoE,另有轻量版GLM-4.7-Flash供本地部署。
MiniMax · 开源
编码能力+百万上下文+原生多模态(图像/视频/桌面操作)三合一。
Mistral · Apache 2.0
明确面向agentic/工具调用场景,ARR已破4亿美元。
把模型包装成能自主决策、调用工具、管理状态的 Agent。2026 年格局:头部整合、腰部分裂 ——微软把 AutoGen 和 Semantic Kernel 都打入维护模式,统一成 Microsoft Agent Framework;与此同时中国开源 LLMOps 平台(Dify star 数已超 LangChain)成为全球采用量最大的赢家。
LangChain · 企业生产环境领跑
图结构低层运行时,约3400万次/月下载,约400家企业用其托管平台。
角色制多智能体 · 轻资本高增长
Agent/Task/Tool/Crew模型+事件驱动Flows,官方称月执行量14亿+次。
Microsoft Agent Framework
微软 · 统一AutoGen+Semantic Kernel
2026年4月GA,MIT协议,Python+.NET双栈,原生MCP支持。
OpenAI · 官方轻量harness
Swarm的生产化继任者,现兼容100+非OpenAI模型。
Anthropic
由Claude Code的能力泛化而来,含生命周期钩子、Skills、可扩展到大规模编排的Workflow工具。
Google · Apache 2.0
代码优先,同时驱动Agentspace等Google内部产品。
Dify
LangGenius(中国)· 采用量最大
开源可视化LLMOps平台,star数超过LangChain/LangGraph,部署应用超100万个。
OpenRouter
模型路由从厂商自建走向标准化基础设施,被支付公司买下
统一网关聚合400+模型,需求端证据:OpenRouter上84%的token流量流向"非SOTA"模型,六个主力模型吃掉81%流量、价格仅为顶级模型的2.5%;月处理token量5个月内从50万亿涨到250万亿。2026-08-19被Stripe以70亿美元以上收购(较三个月前B轮13亿估值跳升逾5倍)——一家支付公司持有模型网关,"还能不能中立地把流量导给最便宜的那家"从假设变成必答题。NVIDIA同期推出NeMo Switchyard多模型路由框架,路由需求被归因为"前沿模型太贵+开放权重太多"同时发生。后续:路由层收购之后竞争没有停——初创公司TrustedRouter拿到125万美元种子轮,Meta据报正在开发内部竞品Switchboard,说明"模型会被压成大宗商品"这套判断正在吸引新的资本和玩家进场,议价权持续从模型层往路由/编排层下沉。
让 Agent 能安全、标准化地连接外部工具和其它 Agent。2026 年最大的标准化事件:MCP 与 A2A 的治理权都并入 Linux 基金会新设的中立机构 AAIF ,此前"协议战争"的焦虑基本解除。
Anthropic发起 · 事实标准
约9700万次/月SDK下载,约28%的财富500强已在生产环境跑MCP服务器;OpenAI已弃用自家Assistants API转投MCP。
Linux基金会 · 中立治理
2025年12月成立,MCP与A2A的共同治理机构,成员含OpenAI/Anthropic/Google/微软/AWS等250+组织。
Agent2Agent(A2A)
Google发起
跨厂商agent发现/任务交接协议,与MCP互补(MCP管agent连工具,A2A管agent连agent),IBM的ACP协议已并入。
Cisco Outshift发起
身份认证/发现/可观测性的补充层,明确定位为"配合MCP/A2A而非替代",75+组织参与。
Agent Plugins 1.0
MCP之后第二个跨厂商开放标准
Vercel牵头,联合Amazon/Cursor/GitHub/Microsoft/OpenAI共同制定(2026-08-06),Google随后以核心维护者身份加入;为Agent Skills与MCP Server定义统一可移植打包格式。同一时期OpenAI把驱动Codex的执行框架开源为Apache-2.0(CLI/app-server/SDK三件套),DeepSeek Harness也以MIT协议开源——三家前沿实验室在同一窗口期把"骨架"层的标准化摆上台面,详见Layer 05编码Agent。
让 Agent"记得住"跨会话信息、管好超长上下文。格局正在向上迁移 :pgvector 成熟后悄悄吃掉了大部分"够用就行"的检索需求,真正的差异化和融资都转移到了"记忆"这个更高的抽象层。
pgvector
Postgres扩展 · 悄悄的整合者
HNSW索引成熟后,很多团队发现根本不需要单独的向量数据库;OpenAI/Supabase/Neon都在用。
专用记忆层
向量+知识图谱混合,2400万美元种子轮+A轮(YC/Peak XV)。
时序知识图谱记忆
Neo4j驱动的双时态事实模型,Graphiti 2万+ star。
原MemGPT · "LLM的操作系统"
核心/归档/回忆分层记忆架构,2.3万+ star。
Google/Purdue · 用结构化状态压缩替代历史重放
不是靠向量检索"找回"记忆,是直接压缩Agent的运行状态本身——论文数据显示跑到第100步时,常规有状态基线要消耗106万个token,SKILL.state只要6.5万,降了约16倍。和pgvector/Mem0这类"存下来再检索"的路线是两个方向:一个解决"记不记得住",一个解决"记着的东西占多少token"。
目前 Agent 最成熟的落地场景,开发者日常接触最密集的产品。2026 年洗牌很剧烈 :Claude Code 在开发者偏好上反超 GitHub Copilot(JetBrains调研:"最受欢迎"46% vs 9%),Windsurf 作为独立品牌已经不存在了(被 Cognition 并入改名 Devin Desktop),Amazon 砍掉 Q Developer 转投 Kiro。估值普遍远超实际用量信号。
Claude Code
Anthropic · 反超者,但生态兼容性有摩擦
终端原生agentic编程工具,所有付费方案自带;JetBrains调研中"最受欢迎"46% vs Copilot的9%。后续:对行业标准AGENTS.md的支持请求(GitHub Issue #6235)2026-08-17被Anthropic工程师标记"已完成"关闭,但截至09-01社区里仍有开发者在分享手动workaround——"标记完成"和"真正好用"之间还有距离,是"反超者"同时在生态兼容性上留摩擦的具体样本。
Cursor
Anysphere · 已被SpaceX/xAI收购,OpenAI随后正式断供
8个月内营收10亿→40亿美元年化,估值传闻500-600亿,但JetBrains数据显示用量已从18%软化到12%。后续:市占率一度达41%,Claude Code以原生agentic形态上游下场后跌至约26%;2026-04 xAI取得收购期权(年底前600亿美元收购或付10亿维持合作),2026-08-14 SpaceX据报已行权完成收购,Cursor与Grok Build/Grok Bot/Grok API打包并入"SpaceXAI"——对价与市占率具体数字暂无官方公告佐证,作者定性为"不是溢价故事,是算力议价权的投降"。收购的连带后果这才落地:2026-08-28 OpenAI官方宣布11月12日彻底停止向Cursor提供模型,理由是"基于埃隆·马斯克旗下公司此前违反合同的经历,没法确信SpaceX会在协议范围内使用这项技术"——平台方第一次把断供理由直接摆在股权归属上,不是技术限制。
GitHub Copilot
微软 · 相对份额下滑
采用率从29%跌到21%(2026年5-7月),品牌知名度仍最高(79%)。
OpenAI · Gartner认证Leader,2026-08骨架层开源
2026年Gartner企业级AI编码Agent魔力象限"Leader"。后续:CLI、app-server与官方SDK三件套以Apache-2.0协议开源(GitHub快照10.7万+ star),并给出量化证据——只调"保留推理"与"上下文压缩"两处骨架设置,同一个GPT-5.6 Sol在ARC-AGI-3上的成绩就从13.3%升到38.3%(同时输出token减少约6倍):模型、权重、训练都没变,变的只是骨架的两个开关。这是本窗口内第二家把agent骨架开源的前沿实验室,另一家是DeepSeek Harness。
Devin
Cognition · 高估值
估值从2025年9月102亿一路谈判至2026年8月传闻400亿,年化营收约4.92亿美元(公司自报);已吸收Windsurf品牌与团队。
Replit Agent
浏览器内应用构建
4个月内营收从3亿到5.25亿美元年化,估值90亿美元。
"Model + Harness = Agent",中国厂商首次系统对标Claude Code/Codex
2026-08-13以MIT协议开源v0.1开发者预览版(基于"Cordis"插件元框架),238个可插拔包+append-only会话日志,配套dsh命令行与Web UI、同步开放npm插件生态,GitHub快照约15万star/1.5万fork(五天内),拆解者定性"Agent时代的Android"。团队由前Jane Street工程师崔添翼自2026年3月组建,直接动因是Anthropic禁止中国大陆访问Claude;社区实测口碑两极——批评者称"产品层面的灾难",早期贡献者反驳"每次pull都是上千commits速度在涨"。关键警示:V4-Flash官方"code-agent"跑分本身就是在DSH minimal模式下跑出来的,模型分数已内含harness贡献,跨厂商比较在agentic任务上第一次变得不可比。
Grok Bot
xAI · 云端全天候自主agent
2026-08-11公测,agent在专属云端电脑上直接操作真实软件界面(非API、非受限沙箱),合上笔记本任务仍继续跑,定价档位与Cursor订阅打通。公开资料里尚未看到它像同期Claude Tag那样详细的花费上限/审计日志说明,与Claude Tag构成"先做能力还是先做治理"的正面对照。
生产环境里"这个 Agent 到底靠不靠谱"的量化答案。安全评测(Inspect AI)和生产监控(LangSmith/Braintrust/Arize)正在成为两条并行赛道。
LangSmith
LangChain · 品类领跑
商业可观测性/评测/部署平台,面临自托管开源方案的定价压力。
评测优先 · 高速增长
8000万美元B轮(Iconiq/a16z/Greylock),估值约8亿美元,客户含Notion/Replit/Cloudflare。
英国AI安全研究院 · 安全评测事实标准
开源安全/能力评测框架,多家AISI和前沿实验室的部署前测试都在用,200+预置评测集。
Arize(Phoenix/AX)
品类领跑
Phoenix开源可自托管,AX为企业级托管版,7000万美元C轮。
给 Agent 一个能放心执行代码/操作的隔离空间。已经成为独立且融资活跃的基础设施品类。
开源 · Firecracker microVM
2100万美元A轮(Insight Partners),据称88%财富100强企业已注册使用。
"每个Agent一台电脑"
冷启动低于90毫秒,2400万美元A轮,star数6.5万+。
Modal
Serverless计算
gVisor隔离沙盒支持GPU,OpenAI Agents SDK官方沙盒供应商。
Browserbase / Stagehand
浏览器自动化
托管无头浏览器基础设施,Stagehand是配套的开源浏览器Agent SDK。
多个 Agent 之间怎么分工、通信、交接任务。行业估计约 70% 的生产级多智能体部署用的是"编排者-执行者"(orchestrator-worker)拓扑。
A2A Protocol
跨厂商标准
150+支持组织,已在供应链/金融科技/保险场景进入生产使用。
CrewAI Crews + Flows
具体产品化实现
无状态角色制Crews + 事件驱动的有状态Flows(含人工介入节点)。
Claude Subagents
Anthropic原生模式
主Agent派生独立上下文的子Agent,Workflow工具可扩展到几十上百个Agent协同。
Agent 最终运行在哪、怎么计费。每家云厂商都在 2026 年推出了专门面向 Agent 的托管产品,计费单元也从"算力时长"细化到了"每次工具调用""每条记忆记录"这类 Agent 原生指标。
AWS Bedrock AgentCore
托管Agent技术栈
Runtime/Gateway/Memory/Identity/Policy等13项能力分别计费,2026年GA。
Google Gemini Enterprise Agent Platform
原Vertex AI Agent Engine + Agentspace
Sessions+Memory Bank作为计费单元,15+项独立计量服务。
Microsoft Foundry Agent Service
原Azure AI Foundry
框架/模型无关,支持A2A(预览)与MCP(1400+工具),Claude已在此平台GA。
Vercel Agent Stack
从前端托管转向Agent基建
2026年6月Ship活动上明确战略转向:"Agent是默认的部署单元"。
Cloudflare Agents SDK
Workers + Durable Objects
持久化有状态Agent运行时,定位"低运维"的长期执行路径。
把"有个checkpoint"到"能跑推理"压缩成两条命令
和上面几家"托管平台"解决的是Agent运行在哪、怎么计费不同,这个工具解决的是更上游的一步——开放模型权重下载下来之后,部署成可用推理服务这段路径本身的工程门槛。
最近的关键变化
MCP 赢了,标准治理权收归中立机构。 MCP 已是无可争议的工具连接默认协议(约9700万次/月SDK下载,约28%财富500强生产环境在用),与 A2A 一起并入 Linux 基金会新设的 Agentic AI Foundation——此前"协议战争"的焦虑基本解除。
编码 Agent 市场剧烈洗牌。 Claude Code 在开发者偏好上反超 GitHub Copilot;Windsurf 作为独立产品已不存在(并入 Cognition 改名 Devin Desktop);Amazon 砍掉 Q Developer 转投 Kiro;估值普遍远超实际用量信号(Cursor 传闻500-600亿估值,但用量数据在软化)。
框架层"头部整合、腰部分裂"。 微软把 AutoGen 和 Semantic Kernel 都打入维护模式,统一成 Microsoft Agent Framework;与此同时中国开源 LLMOps 平台(Dify、Coze、RAGFlow)成为全球采用量最大的赢家。
中国开源模型追近 agentic 跑分差距,价格便宜 5-20 倍,且开始进入西方工具链。 Kimi K2.7-Code 发布仅19天就进入 GitHub Copilot 模型选择器,是首个做到这一点的中国开源模型。
"上下文工程"成为独立学科,记忆抽象层成为新战场。 pgvector 的成熟把"够用"的检索需求悄悄吃进了 Postgres,真正的差异化和融资转移到了 Mem0/Zep/Letta 这类记忆层产品。
沙盒执行与"Agent原生托管"成为独立基础设施品类。 E2B/Daytona/Modal 等专做 Agent 代码执行融资活跃,每家云厂商都推出了按 Agent 原生指标计费的托管产品。
编码Agent的"骨架"层正在同一窗口期集体开源,且带出了"分数不可比"的量化证据。 DeepSeek Harness(MIT)与OpenAI Codex执行框架(Apache-2.0)先后开源,Codex顺手给出的数字是:只调两个骨架开关,同一模型ARC-AGI-3成绩就从13.3%升到38.3%——"模型能力"与"骨架能力"在基准分里已经无法分离,跨厂商agentic跑分对比第一次系统性失真。
模型路由/网关正从厂商自建走向标准化基础设施,并被资本重新定价。 OpenRouter被支付公司Stripe以70亿美元以上收购(较三个月前估值跳升逾5倍),NVIDIA同期推出跨厂商路由框架NeMo Switchyard——"选模型"和"选骨架/路由"正在变成两个独立的采购决策。
头部编码Agent产品出现横向合并。 Cursor被SpaceX/xAI收购、与Grok Bot/Grok Build/Grok API打包进"SpaceXAI",是"算力议价权投降"而非溢价故事的又一例证——自研模型/推理长期被上游卡住的产品,最终被算力方直接吃下。
模型供应权正式变成阵营站队的筹码,不只是市场传闻。 OpenAI官方宣布11月12日彻底停止向Cursor提供模型,是平台方第一次把断供理由直接摆在"你换了股权归属"上——收购的连带影响从传闻变成了正式公告。
路由层的资本竞速在收购之后并未停止。 OpenRouter被Stripe收购只是这层重新定价的开始,TrustedRouter融资、Meta自建Switchboard说明"选路由"正在从单一网关演变成一个有多个玩家争抢的独立赛道。
工程摩擦的战场正从"部署/接入成本"下沉到"人工审查成本"。 SKILL.state证明运行状态本身有巨大压缩空间(单项基准token消耗降约16倍);但更扎眼的是一名SpaceX工程师自曝团队"一觉醒来20个PR自动合并"、基本不看代码了——和另一位开发者"我已经完全不再审查AI写的代码"互相印证,"零人工审查"正从个体实践扩散到头部工程团队。
"标记完成"不等于"真正好用",标准落地比声明更难。 Claude Code对AGENTS.md的支持请求被工程师标记"已完成"关闭,但社区里仍在分享手动workaround——生态兼容性的摩擦,不会因为一次issue关闭就自动消失。
2026-08-26
v1
首次建立:覆盖9层、约50个玩家,基于并行研究(4条研究线:底座模型/协议/记忆;编排框架/多智能体;编码Agent/可观测性;沙盒/部署)汇总整理。
2026-08-26
v2
补充 EP.98/EP.99 窗口内(08-07~08-21)结构性变化:新增DeepSeek Harness、Grok Bot、OpenRouter、Agent Plugins 1.0标准;更新Codex(骨架开源+ARC-AGI-3量化证据)、Cursor(SpaceX/xAI收购)状态。
2026-09-04
v3
据 EP.101 故事线A 补充:更新Cursor节点(OpenAI官方宣布11月12日断供,收购的连带后果落地);更新OpenRouter节点(TrustedRouter融资、Meta内部竞品Switchboard,路由层竞争在收购后持续升温)。
2026-09-04
v4
据 EP.101 故事线C 补充:记忆与上下文管理层新增SKILL.state节点(结构化状态压缩,token降约16倍);部署托管平台层新增NVIDIA TensorRT Model Connect节点;更新Claude Code节点(AGENTS.md支持请求被标记"已完成"但workaround仍在流传);新增两条趋势——工程摩擦下沉到人工审查成本、"标记完成"不等于标准真正落地。
方法论: 入选门槛——在该层有实际产品/协议落地且有可查证来源(官方公告、融资报道、权威技术媒体),不收录纯传闻或未独立核实的信息。每层只挑选当前最具代表性的一批玩家,不追求穷尽罗列。鉴于本图几乎每层都在以4-6周为周期迭代,建议每1-2个月做一次全面复核;日常更新触发于某期 Buzzwords 故事线发现实质性变化时。