现代 AI 工具生态勾勒:11 层 82 款产品与它们的官方链接

按 Rathnakumar Udayakumar 的《Modern AI Ecosystem – Tools》一图,逐层拆解 11 个能力层里的 82 款产品;每条给一句话定位与官方链接。附本机跑过的 46 家 GitHub star 数、5 处 org 迁移与 4 处跨层重复的观察。

这张图 —— Rathnakumar Udayakumar 在 LinkedIn 上发的 The Modern AI Ecosystem – Tools —— 把当下 AI 工程栈铺成 11 圈同心的能力层,每层挂着七到九款代表产品,一眼数出去将近 90 个 logo。

我想把它做成能查、能跳、能补的文本版:每个产品一句话说清位置,附官方链接;再顺手用 gh api 把 46 家开源库的 star 数拉一遍,标出图里被重复挂到两个层的四款产品和悄悄换过东家的五家 repo。

图的意义不在于”数出了 89 个 logo”,而在于 89 个 logo 对应的 11 类外挂,正好覆盖了一台只会说话的下一 token 预测机在真实生产里做不到的每一件事:不会记事、不会用工具、不会检索、不会算相似度、不会自己联网、不会守规矩、不会被审计、不会调度长任务、不会存向量。反过来看这张图更清楚:这个生态的形状,不是市场堆出来的,是「LLM 的能力天花板」这条硬约束长期磨出来的边界

名词速查

缩写 / 层一句话解释
LLMLarge Language Model,能吃 prompt 出 token 的基础模型;一切外挂都是围绕它的短板搭的。
Agentic AI / AI Agent图里分成两层,都是”让 LLM 循环调用工具、维护状态”的编排框架,差别见正文第二/九节。
RAG(Retrieval-Augmented Generation)生成前先检索一段上下文塞给模型,避开”训练时不知道”和”上下文窗口塞不下”两个约束。
Embedding把文本/图片压成一串浮点向量,让相似度可算——RAG 与 Memory 的公共前置。
MCP(Model Context Protocol)Anthropic 2024 年推的开放协议,让 host(Claude/Cursor/Codex)用统一方式调用任何 server 暴露的工具/资源。站内深读过 MCP 2026-07 改版
Guardrails / AI Security在输入/输出上加一道内容审查与合规过滤,防止 prompt injection、PII 泄漏与有害生成。
Observability追踪 LLM 调用的 prompt、response、token、成本与评测分数,给 agent 装黑匣子。见旧文 AgentOps 与可观测性
Memory让 agent 在多轮/多会话之间保留事实、偏好、情节记忆——对抗”一次推理即失忆”的物理事实。
Automation老牌 workflow / iPaaS 系统,把 LLM 拼进现有业务事件与定时任务的管道。
Vector Database存 embedding 并做 ANN(近似最近邻)检索,是 RAG / Memory 的底层存储。

一、根本约束:11 层对应的是 LLM 的 11 个”做不到”

一句话根本约束——

一个原始 LLM 是一个”无状态、无工具、无外部知识、无审计、无格式约束”的下一 token 预测机;这张生态图的每一层,都是补上”无 X”里的一个 X。

这句可反驳。反事实:如果模型天生有持久记忆 + 能主动检索 + 内置结构化工具调用 + 输出自带合规过滤 + 训练即包含最新数据,那 Memory、RAG、Agent、Guardrails、Observability 这五层会同时消失,只剩 Embedding 和 Vector DB 作为它内部的实现细节。这是不是空想?——GPT-5 / Claude 4 系列的确正在把 Memory、Web Search、Code Interpreter 内化,这张图里最先褪色的层已经能看出苗头(见正文第十二节的崩点分析)。

这条约束的价值在于它是可反事实测试的。凡是宣称”我做了一个全新的 AI 工具品类”的产品,都可以问一句:你补的是 LLM 的哪个”做不到”?如果原生模型明天就把这个能力吃掉,你的价值还剩什么?——答不出来的产品,通常是把上一层重新包装。

下面按图里的顺序把 11 层每一款产品都过一遍;每一层先给一句”它到底解决什么”,再上产品清单。


二、LLM:基础模型(9 款)

它解决什么:提供从 prompt 到 token 的核心能力。这一层可以粗分成三类——闭源前沿 API(OpenAI / Anthropic / Google)、开源权重(Meta Llama、Mistral、Cohere Command R、BGE 家族等)、本地/服务化 runtime(Hugging Face、Ollama、vLLM)。

  • OpenAI GPT — 闭源前沿模型 API 的定义者,GPT-5 已内置检索/代码执行。openai.com · platform.openai.com
  • Anthropic Claude — 主打 tool use、长上下文与 Computer Use / Skills 的模型家族。anthropic.com/claude
  • Google Gemini — 多模态原生(原 Bard),API 走 AI Studio 与 Vertex AI 两条线。gemini.google.com · ai.google.dev
  • Meta Llama — Meta 开源权重家族,Llama 3/4 是本地推理与二次训练的默认起点。llama.com
  • Mistral AI — 法国开源前沿实验室,Mistral / Mixtral / Codestral 是欧洲的对标。mistral.ai
  • Cohere — 主打企业 RAG 的 Command R 系列 + 高质量多语言 embedding。cohere.com
  • Hugging Face — 模型/数据集/Space 的公共仓库;transformers 库是事实标准。huggingface.co · transformers 166.1k★
  • Ollama — 一条命令把 GGUF 权重跑起来的本地 runtime,围绕 llama.cpp 构建。ollama.com · ollama 181.0k★
  • vLLM — 服务端高吞吐推理引擎,PagedAttention + continuous batching 的原产地。docs.vllm.ai · vllm 91.8k★

三、Agentic AI:编排框架(8 款)

它解决什么:让 LLM 循环地”读状态 → 想 → 调工具 → 更新状态”,把一次推理串成长任务。这一层的分歧点是「状态用什么表达」:图(LangGraph)、多角色(CrewAI/AutoGen)、工作流 DAG(LlamaIndex Workflows / Strands)、还是纯代码 primitive(Agno / CAMEL)。

  • LangGraph — LangChain 的图式 agent 状态机,节点=函数、边=转移,支持人工中断。langchain-ai.github.io/langgraph · langgraph 41.7k★
  • CrewAI — 多 agent 角色/任务/流程的三段抽象,主打”团队协作”的心智模型。crewai.com · crewAI 58.6k★
  • Microsoft AutoGen — 微软研究院的多 agent 对话框架,v0.4 起分成 Core / AgentChat / Extensions。microsoft.github.io/autogen · autogen 61.0k★
  • Microsoft Agent Framework — 2025 年微软把 Semantic Kernel + AutoGen 融合出的新一代,主打 workflow + orchestration。github.com/microsoft/agent-framework 13.5k★
  • LlamaIndex Workflows — LlamaIndex 家的事件驱动工作流引擎,节点用 @step 装饰器暴露。docs.llamaindex.ai/en/stable/module_guides/workflow/
  • AWS Strands Agents — AWS 2025 年开源的极简 SDK,“一个模型 + 一组工具 + 一个 prompt”三件套。strandsagents.com · sdk-python 7.2k★
  • CAMEL — 学术出身的 Communicative Agents 框架,主打多 agent 协作与合成数据。camel-ai.org · camel 17.7k★
  • Agno — 号称”3μs 启动、~6.5 KiB 内存”的轻量 agent 框架,性能最激进的一款。agno.com · agno 42.2k★

四、RAG:检索增强生成(8 款)

它解决什么:让模型在生成前先从外部知识库拿到相关片段,再基于这些片段回答。分歧点是「怎么把非结构化文档变成可检索的东西」:切分器 + 向量库(LangChain/LlamaIndex/Haystack)、图式关系(GraphRAG)、程序化 prompt 优化(DSPy)、还是端到端产品(RAGFlow / EmbedChain)。

  • LangChain — LLM 应用最早的胶水层,chain/prompt/memory/tool 的原型定义者。langchain.com · langchain 146.4k★
  • LlamaIndex — 原名 GPT Index,主打”数据 → 索引 → 查询”三步的 RAG 数据框架。llamaindex.ai · llama_index 52.2k★
  • Haystack — deepset 出品的模块化 LLM 编排框架,pipeline 是一等公民。haystack.deepset.ai · haystack 26.5k★
  • DSPy — 斯坦福 NLP 的”prompt 是可编译工件”,signature/module/optimizer 三件套自动搜索 prompt。dspy.ai · dspy 38.0k★
  • RAGFlow — infiniflow 开源的端到端 RAG 引擎,主打深度文档解析(表格、公式、图)。ragflow.io · ragflow 90.7k★
  • GraphRAG — 微软研究院把知识抽成实体-关系图再做社区总结的 RAG 路线。microsoft.github.io/graphrag · graphrag 36.0k★
  • Unstructured — 从 PDF/HTML/PPT 里抽结构化元素的开源工具库,被绝大多数 RAG 前端引用。unstructured.io · unstructured 15.4k★
  • EmbedChain — 最早的”三行代码搭 RAG”的库,2024 年整体并入 Mem0 团队。embedchain.ai(现指向 mem0)

五、Embedding:文本/多模态向量化(7 款)

它解决什么:把一段文本/图片压成 384–3072 维的浮点向量,让”相似度可算”。这层是 RAG 与 Memory 的公共前置——没有 embedding,就没有向量检索


六、MCP:Model Context Protocol(8 款)

它解决什么:Anthropic 2024 年推的开放协议,让任意 host(Claude Desktop / Codex / Cursor…)用统一方式调用任意 server(数据库、文件、SaaS)暴露的工具与资源——一次接线到处用。这层是 2024 年后新长出来的,图里全部产品都不到两岁。


七、AI Security / Guardrails:输入输出的护栏(8 款)

它解决什么:在 prompt 与 response 两侧加过滤——挡 prompt injection、抓 PII、限制话题、审查不良内容、给结构化输出加 schema。分歧点是「按什么维度过滤」:策略语言(NeMo Colang / Guardrails Rail)、模型判别(Lakera / Prompt Security)、PII 抽取(Presidio)、还是云厂商全家桶(Azure / AWS)。


八、Observability:LLM/Agent 的黑匣子(8 款)

它解决什么:记录每一次 LLM 调用的 prompt / response / 工具轨迹 / 成本 / 评测分数,让 agent 变成可 debug、可回放、可 A/B 的东西。分歧点:单点追踪(Helicone/LangSmith) vs. 追踪+评测一体(Langfuse/Phoenix/Weave) vs. 纯评测(TruLens/Ragas/Promptfoo)。

  • LangSmith — LangChain 家的托管追踪+评测平台,闭源 SaaS。langchain.com/langsmith · smith.langchain.com
  • Langfuse — 开源版的 LangSmith 对标,主打自托管。langfuse.com · langfuse 34.6k★
  • Arize Phoenix — Arize 家的开源 LLM 观测/评测框架,OpenTelemetry 原生。phoenix.arize.com · phoenix 11.5k★
  • Weights & Biases Weave — W&B 家的 LLM 追踪层,和已有实验平台无缝互通。wandb.ai/site/weave · weave 1.1k★
  • TruLens — 面向 RAG 的开源评测框架,“triad”(context / answer / question)打分。trulens.org · trulens 3.5k★
  • Ragas — RAG 专用的自动评测指标库(faithfulness / relevance / recall),2025 年转到 vibrantlabsai 组织。docs.ragas.io · ragas 15.7k★
  • Promptfoo — 命令行 prompt/RAG/agent 回归测试工具,CI 友好。promptfoo.dev · promptfoo 25.1k★
  • Helicone — OpenAI 兼容的 LLM 代理,插一行就能拿到成本、延迟、缓存分析。helicone.ai · helicone 6.2k★

九、Memory:agent 的持久记忆(8 款)

它解决什么:让 agent 在多轮对话/多个会话之间”记住”事实、偏好与情节,对抗”一次推理结束状态即消失”这条物理事实。分歧点:语义记忆专用(Mem0 / Zep)、agent OS 级持久(Letta)、通用编排里的记忆模块(LangGraph Memory)、还是把老数据库当 KV/图/向量后端用(Redis / Postgres / Neo4j / Chroma)。

  • Mem0 — 专门做 agent 长期记忆的 SaaS + OSS,同时接管 EmbedChain。mem0.ai · mem0 65.3k★
  • Zep — 面向 agent 的时间维度记忆图谱,Community + Cloud 双版本。getzep.com · zep 4.9k★
  • Letta(原 MemGPT) — 把 agent 与其记忆一起持久化的”agent OS”路线。letta.com · letta 24.7k★
  • LangGraph Memory — LangGraph 内置的 short/long-term memory store,可插不同后端。langchain-ai.github.io/langgraph/concepts/memory
  • Redis — 老牌内存 KV,被复用为会话状态与最近记忆缓存。redis.io
  • PostgreSQL — 关系数据库,因 pgvector 也能兼职向量+事实存储。postgresql.org
  • Neo4j — 老牌图数据库,是 GraphRAG / 关系型记忆的常见落点。neo4j.com
  • Chroma — 主打”用起来最简单”的向量库,被大量 agent 拿来当短期记忆。trychroma.com · chroma 29.3k★

十、AI Agent:更薄一层的 agent SDK(7 款)

它解决什么:图里已经单独有一层”Agentic AI”,这一层的差别在于——它们更多是模型厂商 / 云厂商官方推的”一等公民 agent SDK”,而不是社区框架。可以理解为”图里的第二层是社区起家的编排框架,这一层是被官方渠道背书的 SDK”。


十一、Automation:老牌 workflow / iPaaS 拼进 AI(9 款)

它解决什么:图里这一层的重点不是”AI 特有”——是把已有的工作流引擎(Airflow / Temporal / Prefect / Kestra)与 no-code iPaaS(Zapier / n8n / Make / Power Automate / Pipedream)当成 agent 与业务事件之间的胶水。LLM 只是 workflow 里的一步 task

  • n8n — 开源 workflow 自动化,node 生态最丰富的开源 iPaaS。n8n.io · n8n 204.3k★
  • Zapier — 最老牌 no-code 集成 SaaS,2024 年上线 Zapier Agents。zapier.com
  • Make(原 Integromat) — 可视化流程编排 SaaS,主打复杂分支的运营场景。make.com
  • Microsoft Power Automate — 微软的 RPA + 云 workflow 一体化,深耕 Office 365 生态。microsoft.com/…/power-automate
  • Temporal — 面向工程师的持久化 workflow 引擎,Uber 出身,“代码即工作流”。temporal.io · temporal 23.0k★
  • Apache Airflow — 数据工程默认调度器,DAG 是它带火的概念。airflow.apache.org · airflow 46.9k★
  • Prefect — 现代化的 Python workflow 平台,FastMCP 的东家。prefect.io · prefect 23.8k★
  • Kestra — 基于 YAML 的现代 workflow 引擎,主打声明式 + 事件驱动。kestra.io · kestra 28.1k★
  • Pipedream — 面向开发者的 serverless workflow + 集成市场。pipedream.com

十二、Vector Database:ANN 检索的存储层(9 款)

它解决什么:把 embedding 存下来,用 HNSW / IVF / DiskANN 之类的 ANN 索引做”给我最相似的 K 个”。分歧点:向量原生(Pinecone/Weaviate/Qdrant/Milvus/Chroma)vs. 老库加向量能力(Postgres+pgvector / Elasticsearch / MongoDB Atlas / Redis)。

  • Pinecone — 最早的向量数据库 SaaS,闭源、serverless、企业向。pinecone.io
  • Weaviate — 开源 + 云的向量库,主打模块化 vectorizer 与混合检索。weaviate.io · weaviate 16.8k★
  • Qdrant — Rust 写的高性能向量库,主打 payload filter 与 quantization。qdrant.tech · qdrant 34.6k★
  • Milvus — Zilliz 主导的 CNCF 项目,云原生分布式向量库。milvus.io · milvus 46.1k★
  • Chroma — 前面 Memory 层已介绍,同一个项目在这一层扮演的是向量库角色。trychroma.com
  • pgvector — 给 PostgreSQL 加向量类型与索引的扩展,让老库直接兼职。github.com/pgvector/pgvector 23.0k★
  • Elasticsearch — 全文检索老将,8.x 起原生支持 dense_vector + kNN。elastic.co/elasticsearch · elasticsearch 77.9k★
  • Redis — 通过 RediSearch / Redis Stack 提供向量索引,同上不重复。redis.io
  • MongoDB Atlas Vector Search — Atlas 里内建的向量索引,2024 年收购 Voyage AI 后再加 embedding 一并做。mongodb.com/…/atlas-vector-search

十三、亲手实验一:46 家开源库的星标核对

我用 gh api 一口气拉了图里能对到 GitHub 仓库的 46 家 star 数(闭源商用产品如 OpenAI/Anthropic/Google Gemini/Zapier/Pinecone 不在此列),2026-09-15 抓取。命令是一段循环:

for repo in vllm-project/vllm ollama/ollama huggingface/transformers \
            langchain-ai/langgraph langchain-ai/langchain crewAIInc/crewAI \
            microsoft/autogen microsoft/agent-framework run-llama/llama_index \
            ... ; do
  gh api "repos/${repo}" --jq '. | "\(.full_name)\t\(.stargazers_count)"'
done

按数量排序后的 top-15:

#仓库Star
1n8n-io/n8n204,336Automation
2ollama/ollama180,997LLM
3huggingface/transformers166,101LLM
4langchain-ai/langchain146,351RAG
5vllm-project/vllm91,784LLM
6infiniflow/ragflow90,716RAG
7elastic/elasticsearch77,919Vector DB
8mem0ai/mem065,310Memory
9microsoft/autogen60,988Agentic
10crewAIInc/crewAI58,567Agentic
11run-llama/llama_index52,163RAG
12apache/airflow46,857Automation
13milvus-io/milvus46,116Vector DB
14agno-agi/agno42,176Agentic
15langchain-ai/langgraph41,670Agentic

读数得到的三个非显然结论:

  1. n8n 20 万星把整张图压顶——但它 2013 年就有了、跟 AI 关系不大,只是”AI workflow”这个词把它带火了。这张图里最”AI 原生”的第一名是 Ollama,本地 LLM runtime。
  2. RAG 层特别”重”——top-15 里 RAG 占三席(LangChain、RAGFlow、LlamaIndex),Agentic 占四席,加起来 7/15。这跟”最容易把 LLM 拼进业务的两条路是 RAG 与 agent”的行业直觉相符。
  3. W&B Weave 只有 1.1k★——不是它不好,是它作为 W&B 主平台的子模块本来就不独立发星。用 star 数直接比较 SaaS 的子模块与独立项目是错的——这是我抓完数据后自己踩到的第一个坑,写出来给读者。

十四、亲手实验二:5 处 org 迁移(gh api 顺便发现的)

这次抓 star 时 gh api 会自动跟 GitHub 的 301 重定向到当前 canonical URL——图里几款广为人知的项目其实已经不在原来的组织下了

图里挂的名字现在的 canonical repo迁移的意味
jlowin/fastmcpPrefectHQ/fastmcp作者加入 Prefect 当 CTO,项目并入公司组织。
NVIDIA/NeMo-GuardrailsNVIDIA-NeMo/GuardrailsNVIDIA 把 NeMo 家族拆到独立 org。
microsoft/presidiodata-privacy-stack/presidio转给专门的隐私工程社区维护。
explodinggradients/ragasvibrantlabsai/ragasRagas 团队成立公司后 repo 迁到新品牌下。
strands-agents/sdk-pythonstrands-agents/harness-sdkSDK 改名为 harness-sdk,反映从”agent”到”harness”的抽象升级。

这一处踩坑值得写下来:如果你按图里印的 logo/名字直接 pip install 或 clone,很可能装到的是已经归档的旧版。认 owner/repo 前先跟一下 301——gh api repos/OWNER/REPO --jq .full_name 是一条比 curl 更靠谱的核对命令。

十五、跨层重复:图里 4 款产品被挂到两层

按顺序数一遍,会发现同一款产品在图里挂了两次:

产品被挂在为什么
ChromaMemory + Vector DB底子是向量库,被 agent 生态广泛拿来做短期记忆存储。
RedisMemory + Vector DBKV/缓存原生 + RediSearch 向量索引,一物两用。
PostgreSQLMemory + Vector DB(隐式,via pgvector)关系库 + pgvector 扩展,同一物两个层看它。
LangGraphAgentic AI + Memory(LangGraph Memory)编排框架自带记忆子模块。

再加两处近似重复:LangChain(RAG 层)与 LangChain Agents(AI Agent 层)实为同一项目的两个子模块;LlamaIndex(RAG 层)与 LlamaIndex Workflows(Agentic 层)同样是一家的两条产品线。这不是画图的人偷懒,而是”工具能力越界”的真实反映——一款产品最初为一个层设计,被社区拿去补另一层的空缺,图上就出现两次。

对读者的实操含义:看这张图选型时,“某个 logo 只出现一次”比”某个层里有几个 logo”更值得琢磨——只出现一次的,通常是这个能力的最直接原生做法;出现两次的,说明它在其中一层里其实是”替补上场”

十六、崩点:抽掉哪个约束,哪一层最先消失

这一条是”根本约束”的可反驳性测试。

  • 抽掉”LLM 无记忆”(前沿模型内置持久 memory):Memory 层与 AI Agent 层的 memory 模块最先塌。OpenAI 已经在 ChatGPT 里内置 “Memories” 一年多、Anthropic Claude 也上线了 Memory Tool ——用户级 memory 在应用层已经消失了一半;剩下的空间是开发者可控、跨 host、可审计的记忆——这也是 Mem0 / Zep / Letta 都在讲”给开发者的记忆基础设施”而不是”给用户的记忆功能”的原因。
  • 抽掉”LLM 无检索”(模型自带联网/知识库检索):RAG 层塌一半。这已经在发生:GPT-5 的 web_search、Claude 的 Search Tool、Gemini 的 Google Search grounding,都把”basic RAG”内化。留给 RAG 层的空间是”我的私有数据 + 我的检索策略 + 我的 rerank”——这也是 GraphRAG / RAGFlow / DSPy 而不是 LangChain “拼一个 RetrievalQA” 的方向。
  • 抽掉”LLM 无格式约束”(模型稳定输出 JSON/结构化):Guardrails AI 与 PydanticAI 的核心卖点被吃掉半个——OpenAI Structured Outputs + Anthropic Tool Use 已经保证 JSON 合法性,护栏库剩下的价值集中在业务级校验(“这个价格必须在这个 range 里”)而非”输出不是 JSON”。
  • 抽不掉的两层是 MCP 与 Vector DB:前者是跨模型的协议标准,越是被 GPT/Claude/Gemini 同时用越有价值——单个模型厂商吃不掉标准;后者是物理存储 + ANN 索引,模型再强也无法把千亿条向量塞进 context。这两层是这张图里最不会被”模型吃掉”的骨架

十七、共同祖先:这张图不是新东西,是老系统架构套上 LLM

把 11 个层挂到更老的想法上,读者就多了一个坐标。

图里的层更老的祖先承担的角色
Agentic / AI AgentActor 模型、workflow 引擎(Airflow/Temporal)、蓝图编程”状态机 + 事件驱动”套在 LLM 决策上
RAG全文检索、企业搜索(Elasticsearch、Solr、Coveo)把 “先搜再答” 从人机 UI 抬到模型 pipeline
Embedding + Vector DB信息检索里的 tf-idf/BM25/Word2Vec、KNN 搜索相似度检索的连续版
MCP传统 RPC / gRPC / OpenAPI + LSP(Language Server Protocol)客户端-服务器协议,但客户端是 LLM host
Memory数据库 + KV 缓存 + 图数据库的老组合把”事务/会话”的老概念挪到 agent 状态
GuardrailsWeb 应用防火墙(WAF)、内容审核、schema validator输入输出安全套在 prompt/response 上
ObservabilityAPM(Datadog/New Relic)、trace(OpenTelemetry)trace 树的每个 span 变成一次 LLM 调用
Automation老 iPaaS / RPA / 数据流水线LLM 只是 workflow 里的一步 task

只有 MCP 在祖先侧比较年轻(LSP 出生在 2016 年)——其他 10 层几乎都能对到 2010 年前就有的系统架构模式。这张图与其说是”AI 生态”,不如说是”十几年前的分布式系统 stack + 中间那颗 LLM”。

十八、边界卡:这张图会误导你的三个地方

用这类”生态全景图”选型时,最容易踩的三个坑——

  1. 同层产品之间不是同类可比。RAG 层里 LangChain 是通用胶水RAGFlow 是端到端 SaaSGraphRAG 是研究方案DSPy 是 prompt 优化器——放在同一层是”都跟检索有关”,不代表你可以在四者之间做”选型 A vs B”。先问自己”我要的是胶水、产品、方法还是编译器”,再进这一层。
  2. 层内的产品数量不代表市场空间。Vector DB 层挤了 9 家不是因为向量检索热,而是因为这一层是老数据库厂商加个 vector 索引就能挤进来的最低门槛——真正的赢家可能是 pgvector 这种”什么都不做只做扩展”的方案。
  3. 图里没画的一层:Model Gateway(如 LiteLLM、Portkey、OpenRouter、Bedrock 本身)——把多家模型 API 抽象成同一入口。这是 2024 年后单独长出的一层,但没出现在图里。看到这类全景图时先问一句”我实际用的哪一层它没画”,答案往往能揭示这张图的作者的视角边界。

小结

  • 根本约束:这张图之所以长成 11 层,是因为一个原始 LLM 是无状态、无工具、无外部知识、无审计、无格式约束的下一 token 预测机。每一层都在补那个”无 X”里的一个 X。抽掉这条约束(即”模型自己吃掉这个能力”),对应的层就塌。
  • 崩点Memory / RAG / Guardrails 已经在被前沿模型吃掉一半(GPT-5 记忆、Claude 检索工具、Structured Outputs);MCP 和 Vector DB 是不会被吃的骨架——一个是跨厂商协议,一个是物理存储。
  • 共同祖先:11 层里有 10 层能对到 2010 年前就有的系统模式(Actor、全文检索、KNN、RPC、KV、WAF、APM、iPaaS)。这不是”新生态”,是老架构 + 中间一颗 LLM
  • 可带走的动作:拿到任何”AI 生态全景图”时,别数产品数,问三件事——(a) 这一层解决的是 LLM 的哪个”做不到”?(b) 它会不会被模型明天吃掉?(c) 图里漏掉了哪一层?三个问题答得清,图才对你有用;答不清,图只是一张 PPT 素材。

参考来源

工程实践

站内相关