近年来在企业 AI 领域,一个反直觉的趋势反复出现:底层 LLM 的能力越来越强,但生产系统中直接调用 LLM 的比例却在下降。大量团队从
User Query → LLM → Answer的 demo 架构,转向更复杂的分层调度:规则、词典、缓存、传统 ML、Embedding 检索、LLM,按某种顺序组合使用。这个转向背后的核心判断是:企业 AI 的目标不是”让 LLM 做所有事”,而是”让 LLM 只做只有 LLM 才能做的事情”。
本文将这种设计思想形式化为 Progressive Intelligence Architecture(PIA),讨论它的分层地图、与模型级联/路由/MoE 等先行工作的区别,以及它的适用边界与反模式。
需要说明的是,PIA 不是对当下某种流行实践的归纳,而是我在过去一年企业 AI 落地中的观察基础上,首次系统提出并正式命名的架构思想。
本文基于行业常见实践进行抽象分析,不指向任何具体公司、团队或项目。
引言:一个正在发生的悖论
LLM 的能力曲线仍在快速爬升。GPT-4、Claude、Gemini 在代码、推理、多语言上的进步有目共睹,一个自然而然的推论是:企业系统应该越来越多地依赖 LLM。但落地实践给出的答案相反——生产级企业 AI 系统中,直接调用 LLM 的比例正在下降。
下降的不是对 LLM 能力的需求,而是对 LLM 调用方式的信仰。越来越多的团队发现,把所有 query 不分轻重地丢给 LLM,在成本、延迟、稳定性、可解释性和一致性上同时撞墙。LLM 仍然是系统里最强的单点智能,但它正在从”前台默认入口”退位为”后台兜底资产”。
这个现象不是技术倒退,而是一种新的架构思想正在成形。我把这种思想称为渐进式智能(Progressive Intelligence),并在本文中将其形式化为 Progressive Intelligence Architecture(PIA)。它不是对某个已有概念的重新包装,而是基于落地观察首次系统提出的一套企业 AI 架构原则。
它的核心问题不再是”这个问题 LLM 能不能解”,而是”解决这个问题,最低需要哪一级智能”。前者几乎永远得到肯定答案,后者才会让系统为每一分钱、每一毫秒负责。
第一章:LLM-first 架构的五堵墙
把 LLM 作为默认入口的架构,在 demo 阶段几乎无懈可击。但进入生产环境后,它会连续撞上五堵墙。这五堵墙不是偶发问题,而是 LLM-first 设计哲学的结构性后果。
1.1 成本墙:字典题和推理题付同一个价钱
企业流量的大头从来不是开放问题。客服、内部知识库、运维问答等场景的经验分布显示,七成以上的 query 是高频、重复、答案已经存在的问题——查一个词义、查一个流程、查一个状态码。它们要的不是推理,是查找。
但 LLM-first 架构对所有 query 收同一个价签。一次本地查表,耗时不到 1 毫秒,边际成本约等于零;一次主流旗舰模型的 API 调用,每百万 token 数美元起步,端到端延迟 2 到 10 秒。同样是”SEC 是什么意思”,两种解法的成本差着四到五个数量级。
更隐蔽的是链条成本。LLM-first 系统常常不是一次调用,而是 Query Understanding → Planner → Retrieval → Generation 的多级调用,每级又可能并发多个 LLM。简单问题被强制走完整推理链,等于用超级计算机查字典。
1.2 延迟墙:秒级响应 vs 毫秒级期望
企业用户对延迟的容忍度远低于 C 端聊天机器人。内部工具、客服辅助、实时风控等场景,用户期望的是秒级甚至亚秒级响应。而 LLM 的生成式延迟天然在秒级,多级 chain 叠加后很容易冲到十秒、几十秒。
本地规则匹配是微秒到毫秒级;BERT 级分类器是几十到几百毫秒;Embedding 检索是百毫秒级;LLM 生成是秒级。每往上一层,延迟差出一个数量级。当系统把简单问题也绑在 LLM 上时,它不是在为”智能”付费,而是在为”不必要”付费。
1.3 不稳定墙:同一条 query,两次答案可能不同
LLM 是概率模型。temperature、top-p、上下文窗口、模型版本、甚至 prompt 中示例的排列顺序,都可能让同一条 query 得到不同措辞、不同结论。对 C 端聊天机器人,这叫”有个性”;对要过审计、签合同、定赔付的企业系统,这叫事故。
企业系统要的从来不是惊喜,是可预期。同一个问题,周一和周四应该得到同样答案;同一个用户,用两种措辞表达同样意图,应该被同样处理。LLM 的不确定性让这一点很难保证。
1.4 不可解释墙:无法审计决策路径
LLM 的决策路径藏在数百亿参数和注意力权重里。当系统给出错误结论时,工程师能看到的只是一个输出;无法像调试规则引擎那样,逐行追踪”为什么走这条分支、为什么引用这个来源”。
在金融、医疗、法律、保险等强合规场景,不可解释直接等于不可上线。审计人员不会接受”模型就是这么生成的”作为答案。他们需要知道:系统为什么选这个答案、依据是什么、哪一步可以复核、错误发生在哪一层。
1.5 一致性墙:无法保证同义同答
同一概念的不同说法,可能让 LLM 给出不同回应。“退款多久到账”、“我什么时候能收到退款”、“钱什么时候退回来”,在规则系统里指向同一条规则;在 LLM 里,可能因为上下文分布不同而给出略有差异的流程描述。
对企业系统而言,一致性是信任的基础。一个会”看心情”回答的系统,无法被集成进 SOP,也无法被业务方放心使用。LLM-first 架构没有显式的同义归一机制,一致性只能靠 prompt 祈求,风险极高。
第二章:渐进式智能的定义
2.1 不是”遇到难题才上最强模型”
很多人对”渐进式智能”的第一反应是:先让小模型试,不行再换大模型。这个理解只对了三分之一。渐进式智能不是”在 LLM 内部做模型选型”,而是把规则、传统 ML 和 LLM 放进同一个智能层级,让系统从最低成本层开始尝试。
它的关键切换是:LLM 不是第一道防线,而是最后一道防线。规则能解决的,不给 ML;ML 能解决的,不给 LLM;只有前两层都失败或置信度不足时,才升级到 LLM。这不是降级 LLM,而是让 LLM 只做它真正不可替代的事。
2.2 核心原则:Minimum Necessary Intelligence + Sufficient Confidence
渐进式智能可以压缩成两个条件的合取:
- Minimum Necessary Intelligence(最低必要智能):永远先使用能够解决问题的最低级别智能。
- Sufficient Confidence(足够置信度):只有当当前层能够以足够置信度解决问题时,才停止升级。
两个条件缺一不可。只看”最低智能”,系统会在 L1 自信地给出过期或错误答案;只看”置信度”,一个未经校准的 LLM 可能永远认为自己”足够自信”。因此落地时必须配套置信度校准、金丝雀抽检和分层阈值学习。
2.3 与 Cascade / Router 的根本区别:跨范式、双向流动、可治理
FrugalGPT、AutoMix、RouteLLM 等先行工作与 PIA 有相似之处,但存在三个根本差异:
- 跨范式 vs 模型内/模型间:Cascade 和 Router 基本都在 LLM 之间做选择——小 LLM 换大 LLM,本质仍是模型选型。PIA 把规则、词典、缓存、KG、传统 ML、LLM 放进同一层级,横跨确定性、统计、生成三种范式。
- 双向流动 vs 单向升级:Cascade 是单向链:小模型不行就换大模型。PIA 除了升级(Escalation),还有下沉(Sinking):L3 解决过的问题沉淀回 L1/L2,让系统越用越便宜。
- 可治理 vs 静态结构:现有工作大多缺少生命周期治理——规则过期、模型漂移、问题分类老化等问题没有闭环。PIA 把问题分类、资产回收、漂移检测作为架构的一等公民。
第三章:三层智能地图
企业 AI 系统里可用的智能,大致可以分成三层。这不是怀旧,而是对问题空间的一种尊重:不同问题有不同的认知难度,应该匹配不同层级的智能。
3.1 L1 确定性智能:规则 / 词典 / 缓存 / KG
L1 处理的是 Known Knowns——问题和答案都是确定的,可以枚举、可以写成规则。典型资产包括:
- 规则引擎:if-then 规则、状态机、决策表。
- 别名与词典:术语标准化、缩写映射、同义词表。
- 缓存:历史高频 query 的答案直接复用。
- 知识图谱:实体关系明确的结构化知识。
L1 的特点是快、稳、可解释。一次查表不到 1 毫秒,行为完全确定,出错时可以直接定位到哪条规则。SEC → Securities and Exchange Commission 这类问题,完全不需要 LLM。
3.2 L2 统计智能:传统 ML / Embedding / 检索 / 重排
L2 处理的是 Known Unknowns——你知道问题属于哪一类,但具体表述千变万化,需要泛化能力。典型资产包括:
- 分类器:意图识别、情感分析、风险打分。
- Embedding 检索:语义相似度匹配。
- Reranker:对候选结果重新排序。
- 实体链接与 NER:从非结构化文本中提取并链接到标准实体。
L2 的成本和延迟仍然可控。BERT 级模型在 CPU/GPU 上通常是几十到几百毫秒,Embedding 检索在百毫秒级。它能处理模糊和相似,但仍在可预定义的问题空间里。
3.3 L3 生成式智能:LLM / Agent / 规划
L3 处理的是 Unknown Unknowns——问题空间无法预先枚举,需要推理、规划、开放生成。典型能力包括:
- 多跳推理:跨多个文档或工具推导结论。
- Agent 规划:分解任务、调用工具、动态调整路径。
- 开放问答:没见过的问题,靠推理现场生成答案。
LLM 是这一层的核心,也是唯一能做开放推理的资产。但它同时是昂贵、缓慢、不确定的。PIA 的主张是:只有前两层解决不了的问题,才进入这一层。
3.4 两个原则:Capability Increases + Cost Increases
把三层叠在一起,得到两个贯穿始终的原则:
- Capability increases(能力逐层增强):越往上,能处理的问题越开放、越模糊、越需要推理。
- Cost increases(成本逐层增加):越往上,钱越多、延迟越高、行为越不确定。
两个”increases”叠加,推导出 PIA 的核心动作:系统必须始终优先停留在最低能够解决问题的那一层。每往上一层,都是在为更强的能力支付更高的成本,所以升级必须是一种被迫,而不是一种习惯。

第四章:与现有工作的关系
PIA 的底层机制并不新。学术界和工业界在”按需升级”上已经做了不少扎实工作。PIA 的价值不在重新发明机制,而在把分散的先行工作放进同一个架构框架,并补全它们缺失的部分。
4.1 FrugalGPT:模型级联的典范,但停在 LLM 内部
FrugalGPT(Stanford, 2023)按成本从小到大级联调用模型,论文报告在保持质量的前提下推理成本最多下降 98%。它的核心假设是:很多问题不需要最强模型,小模型足够时就应停止。
这个思路 PIA 完全继承。但 FrugalGPT 的级联发生在 LLM 之间——小 LLM → 中 LLM → 大 LLM。它没有把规则、词典、传统 ML 纳入同一层级,也没有讨论升级之后的沉淀与治理。
4.2 AutoMix:自验证升级,但仍是单链
AutoMix 让小模型自评置信度,不够再升级大模型。它比固定级联更灵活,因为每层可以自己决定”我不行”。
但 AutoMix 仍然是一条单链:升级后不再下沉,也没有生命周期管理。一个被 L3 解决过一百次的高频问题,在 AutoMix 里每次都要重新走一遍判断流程;而在 PIA 里,它会被沉淀到 L1 缓存或 L2 分类器。
4.3 RouteLLM / HybridLLM:路由是预判,不是兜底
Router 系列用一个分类器预先判断 query 难度,直接路由到合适模型。优点是省掉中间尝试,延迟低;缺点是路由错了没有安全网。当分布漂移时,Router 往往最先失效,而系统对此浑然不觉。
PIA 可以包含 Router 作为主动路由模式,但永远保留”Router 不确定时退化为被动升级”的兜底路径。路由是优化,不是架构的全部。
4.4 MoE:把专家藏进参数,不可审计
Mixture of Experts 把”按需激活专家”的思想嵌入了模型内部。每个 token 只激活少量专家网络,兼顾容量与效率。
但 MoE 的专家是同质神经网络, specialization 是涌现出来的,人类无法直接审计”为什么选这个专家”。MoE 是模型内的渐进式智能,PIA 是系统级的 Mixture of Experts。PIA 的每层资产都是显式、可枚举、可摘除的。
4.5 Cascade Models / Progressive Enhancement:思想同源,缺少治理
更早的 Cascade Models 和前端领域的 Progressive Enhancement 都体现了”逐层增强”的思想:先提供基础能力,再为更复杂的需求增加更高层能力。
这些思想的共同局限是缺少治理闭环。它们描述了”如何分层”,但没有回答”层与层之间如何流动""资产如何过期回收""问题如何分类运营”。PIA 把”逐层升级”扩展为”有生命周期的智能生态”。
4.6 PIA 的继承与新增
一句话概括光谱:
MoE 是模型内的渐进式智能,PIA 是系统级的 Mixture of Experts;Cascade 是 PIA 的执行引擎,PIA 是 Cascade 的完整世界观。
PIA 继承了先行工作的”按需升级”思想,新增了三个东西:
- 跨范式分层:规则/词典/KG/传统 ML/LLM 被纳入同一智能层级。
- 双向流动:升级 + 下沉,让系统越用越便宜。
- 可治理架构:问题分类、资产 GC、漂移检测、金丝雀抽检成为一等公民。
| 维度 | MoE | Cascade / FrugalGPT | Router | PIA |
|---|---|---|---|---|
| 作用尺度 | 模型内部、token 级 | 模型之间、单次推理 | 模型之间、单次推理 | 系统级、问题级 |
| 专家构成 | 同质神经网络 | 同类模型(小→大 LLM) | 候选模型池 | 跨范式:规则/ML/LLM |
| 分层依据 | 无(特化自发涌现) | 模型成本 | 预测难度 | 问题的认知类型 |
| 升级能力 | 无 | 有(单向升级) | 无 | 有(升级 + 下沉) |
| 可解释性 | 低 | 中 | 中 | 高(资产显式可审计) |
| 生命周期治理 | 无 | 无 | 无 | 完整闭环 |
| 代表 | Mixtral、DeepSeek | FrugalGPT、AutoMix | RouteLLM、HybridLLM | 本文首次提出 |
第五章:正式命名、设计原则与适用边界
5.1 正式命名 PIA + 英文定义
如果把这种思想沉淀为一种架构范式,我建议正式命名为:
Progressive Intelligence Architecture(PIA)
定义为:
An enterprise AI architecture that progressively escalates across deterministic logic, statistical models, and generative reasoning, selecting the minimum level of intelligence required to solve a task with sufficient confidence, while allowing solved problems to sink back to lower layers for reuse and governance.
关键词:progressively escalates、deterministic、statistical、generative、minimum intelligence necessary、sufficient confidence、sink back、governance。这几个词的组合,目前没有人系统提出过。
5.2 两条设计原则
PIA 的设计原则可以压缩为两条:
原则一:Minimum Necessary Intelligence(最低必要智能)
系统永远先使用能够解决问题的最低级别智能。LLM 是昂贵、缓慢、不确定的智能,只应被用于刀刃之外无法替代的场景。
原则二:Capability & Cost Increase Monotonically(能力与成本单调递增)
从 L1 到 L3,能力逐层增强,成本也逐层增加。系统必须优先停留在能力与成本匹配的最低层;每往上一层,都是因为被迫,而不是习惯。
5.3 三个架构模式
根据生产实践,PIA 常见三种实现模式:
模式一:Escalation(被动升级)
从 L1 开始逐层尝试,每层自己报告”我不行”:L1 未命中则升级,L2 置信度不足则升级,L3 自验证失败则人工兜底。优点是简单、有安全网;缺点是最坏路径延迟较高。
模式二:Sinking(智能下沉)
L3 解决过的问题,通过缓存、规则归纳、分类器训练等方式沉淀回 L1/L2。系统运行一段时间后,问题不断从高层向低层迁移,平均成本和延迟持续下降。这是 PIA 区别于静态 Cascade 最关键的特征。
模式三:Category-based Governance(分类治理)
按问题大类(Problem Category)监控每类 query 的层分布、升级率、单均成本、规则命中率衰减。治理动作以类为单位:某类长期 90% 靠 L3,说明它”没被固化”;某类升级率突然爬升,说明它在变种。没有分类视角的 PIA,只是一张流程图。
5.4 适用条件 checklist
PIA 不是万能药。它的收益有明显的规模门槛。以下场景更适合采用 PIA:
- 高频:query 量级足够大,让”70% 以上走 L1/L2”的收益能够摊薄治理成本。
- 多业务线:不同业务有差异化的意图体系和合规要求,需要按类治理。
- 强合规:需要审计路径、来源可解释、答案一致性可保证。
- 长生命周期:系统预期运行一年以上,资产的沉淀、漂移、回收有价值。
- 存在结构化解决路径:至少 50% 以上的问题可以被规则、词典或传统 ML 部分覆盖。
如果以上条件大部分不满足,LLM-first 的简单方案可能更经济。
5.5 反模式
PIA 在落地过程中有几种典型反模式:
- 把 PIA 当成模型路由:只在 LLM 之间做小→大选型,忽略规则和传统 ML 层。
- 认为层数越多越好:强行拆出五层、六层,但每层都缺乏清晰的问题类型边界和置信度判据。
- 忽视置信度校准:直接拿 softmax 概率或 LLM 自评当升级信号,导致该升的没升、不该升的乱升。
- 静态架构不治理:只建层不做下沉、不监控漂移、不回收过期资产,最终规则库腐烂。
- 让 LLM 处理 L1/L2 能做的事:因为”LLM 更通用”,把本可以规则化的问题留给 LLM,重新走回 LLM-first 的老路。
5.6 与简单方案的边界
PIA 的治理体系本身有复杂度成本:分类器训练、阈值学习、漂移监控、资产 GC、金丝雀抽检。对于低并发、单业务线、短生命周期的系统,这些成本可能超过 LLM-first 的浪费。
简单方案的边界大致是:
- 日均 query 低于数千次;
- 问题类型高度开放,难以结构化;
- 没有强审计要求;
- 系统生命周期短于三个月;
- 团队没有工程资源维护规则库和分类器。
超出这个边界,PIA 的收益才会显现。一个能指出自己不适用的架构思想,才值得信赖。
结语
回到引言里的悖论:LLM 越来越强,企业系统反而越来越少直接调用 LLM。这个悖论的解释现在已经很清楚——企业 AI 的目标不是拥有最强的模型,而是最合理地调度不同层次的智能。
PIA 给出的答案是:把 LLM 从”默认入口”放回”最后防线”,让规则处理确定性问题,让传统 ML 处理可泛化问题,让 LLM 只处理真正开放的问题。并且让已经解决的问题不断下沉,让系统在运行中变得更便宜、更稳定、更可解释。
一句话收束:
让 LLM 只做只有 LLM 才能做的事情,其余一切都交给更便宜、更确定、更可审计的智能层。
后续两篇将分别回答两个问题:第二篇讨论为什么 Rule、传统 ML 和 LLM 不会互相取代——三层智能各自的问题空间和不可替代性;第三篇讨论企业 AI 的未来形态——不是模型竞赛,而是智能调度。
这个系列的核心判断不变:真正成熟的 AI 系统,不是 “LLM Everywhere”,而是 Progressive Intelligence。