你有没有这样一种感觉——
2023 年用上 GPT-4 的时候,那种震撼是真实的:它居然能写代码、能推理、能理解上下文。每发布一个新版本,你会迫不及待去试。但现在呢?GPT-5.6 发布了、Claude Fable 5 来了、Kimi K3 也出来了——你的第一反应是不是变成了:「哦,又强了一点。」
不是它们不够强。GPT-5.6 Sol 在复杂推理上确实甩开了上一代一大截。问题在于:你 90% 的日常任务,两三年前的模型就已经够用了。
这不是观点,是正在发生的现实。这篇不聊模型有多强,聊一个更实际的问题——为什么大部分 AI 项目依然在失败,以及真正该花精力在什么地方。
2026 年的模型版图
先看看我们现在有什么。
把今天的主流模型放在一张图里,按能力和价格两个维度看:
数据来源:OpenRouter API(2026-07 实时定价),涵盖 344 个模型。OpenAI GPT-5.6 于 2026 年 7 月 9 日发布,Claude Fable 5 于 6 月 9 日发布。DeepSeek V4 Pro 于 4 月开源,1.6T 参数/49B 活跃参数,1M 上下文。Kimi K3 据称可媲美 OpenAI 和 Anthropic 的旗舰模型。
这张图的信息量比看起来大。注意定价跨度——旗舰层和主力层之间是 5-10 倍的价格差,和 DeepSeek V4 Flash 比更是 100 倍的差距。更深层的信号是:经济层的模型能力线已经远远到了日常任务「够用」的基准线之上。 日常任务不需要旗舰模型的原因不是「没钱」,是「没必要」。
80/15/5 的分层现实
那实际在用的时候是怎么选的?
以我托管的 hermes-home 多 Agent 系统为例——它跑着 7 个 Agent,每天处理调研、写作、决策分析、知识管理等任务。实际用量比例:
| 层级 | 模型 | 用量 | 场景 |
|---|---|---|---|
| 经济层 | DeepSeek V4 Pro($0.44) | ~80% | 日常推理、内容生成、知识检索、决策辅助 |
| 主力层 | GPT-5.6 Luna($1.00) | ~15% | 需要更强推理能力的复杂任务 |
| 旗舰层 | GPT-5.6 Sol / Claude Fable 5 | ~5% | 高难度代码生成、架构设计、研究级分析 |
这不是预算问题。换成 DeepSeek V4 Pro 每百万 token 只需 $0.44,全跑旗舰模型(Claude Fable 5 $10/1M)也就多花二十几倍。真正的原因是:对于 80% 的任务,换旗舰模型的提升用户感知不到。
写一篇博客、整理一份调研、做一个决策分析——这些任务 DeepSeek V4 Pro 完成得很好。只有当你需要处理极其复杂的推理链条、或者生成需要深度理解上下文的高难度代码时,旗舰模型的优势才会显现。而且即便是这些时候,差距也在快速缩小:DeepSeek V4 Pro 的 Benchmark 已经追平了两年前的旗舰模型。
现在,旗舰模型针对的是「不可能轻松做到的业务」,是「需要博士级的研究分析」,是「5% 的场景」。大部分公司的绝大部分业务和大部分个人的日常任务,处在那个 80% 的范围内。
AI 项目真正的死因
如果模型已经够用了,那为什么那么多 AI 项目还是失败了?
RAND 公司对 65 个企业 AI 项目的元分析给出了一个发人深省的数字:80% 的企业 AI 项目以失败告终。 Gartner 的追踪数据给出了类似的结论,MIT 的研究甚至将这个比例推高到了 95%。这些项目不是用 DeepSeek V4 Pro 做的——很多花了大价钱上了最好的模型。
导致项目失败的原因,排在最前面的从来不是「模型不够聪明」。
数据来源:RAND 企业 AI 元分析(65 个项目,80% 失败率)、MIT 研究(95% 企业 AI 项目未交付价值)。
我跑了几个月多 Agent 系统,最深的感受就是:模型从来不是瓶颈。 出错最多的地方,永远是需求没对齐、成本估算偏差、以及系统工程的细节。
真正卡脖子的三件事
如果瓶颈不是模型,那是什么?基于实战观察,我认为有三件事比模型选型重要得多。
需求挖掘:你确定你在解决对的问题?
大部分 AI 项目死得冤枉。团队花了几周时间搭建一个完美的 RAG 流水线,上线后发现用户根本不需要这个功能。或者花了大价钱微调了一个模型,结果业务需求已经变了。
这不是技术问题,这是需求挖掘问题。一个简单的判断标准:你能否一句话说清楚「这个 AI 系统做成了,用户的什么行为会改变?」 如果你说不清楚,模型再强也没用。
真实教训:hermes-home 里有一个 Agent 最早的设计是「帮我决定今天做什么」,上线后完全没人用。后来改成「帮我记录和管理待办事项」,用户每天在用。模型没换,Prompt 也没大幅改——换的是解决哪个问题。
成本控制:不分层的架构跑不远
很多团队的做法是:选一个最强的模型,全量流量都走它。结果第一个月账单出来,团队傻眼了。
分层的逻辑很简单:不是所有请求都值得用最好的模型处理。 80% 的请求可以用 DeepSeek V4 Pro 甚至 V4 Flash,15% 需要 GPT-5.6 Luna 级别,只有 5% 需要动用旗舰模型。
实操层面,成本优化的手段远不止分层:
- 语义缓存:重复查询命中缓存,彻底省掉模型调用
- Prompt 压缩:精简历史记录和上下文,减少 token 消耗
- Fallback 链:小模型先处理,处理不了再升级到大模型
- 输出长度控制:很多场景不需要完整输出,设置 max_tokens 能省一大半
2026 年的行业共识是:一个设计良好的分层架构,可以将 LLM 成本降低 30-50%,同时保持 95% 以上的用户体验不下降。
Agent 工程:能力是 Engineering 出来的,不是模型送过来的
这是最容易被忽视、但也是真正的壁垒所在。
从 GPT-3.5 到 GPT-5.6,模型能力在涨。但把一个 LLM 从「能回答问题」变成「能可靠地完成一个任务」,需要的是一整套工程能力——
- Tool 设计:模型需要知道自己有什么工具可用,每个工具的输入输出是什么,什么时候该用哪个
- Memory 管理:会话历史、长期记忆、知识库检索——怎么存、怎么查、怎么不爆上下文
- 错误处理:模型调用超时怎么办?工具返回异常怎么办?重试逻辑怎么写?
- 可观测性:每次调用花了多少 token?哪个环节耗时最长?出错了怎么定位?
- 多 Agent 协作:多个 Agent 之间怎么发现彼此的能力、怎么传递任务、怎么避免冲突
这些东西,换再强的模型也不会自动变好。它们需要工程投入。
实战案例:一个跑在 DeepSeek 上的多 Agent 系统
hermes-home 是一个真实运行的多 Agent 系统,7 个 Agent 分布在云服务器和本地 Docker 中,通过 MCP 协议通信。这个系统 80% 的请求由 DeepSeek V4 Pro 处理。
它能做什么?
- 知识库 Agent 每天自动扫描 GitHub 新项目,整理入库
- 博客 Agent 从知识库拉取素材,写成 Hugo 文章并部署
- 待办 Agent 管理日常任务并定时提醒
- 决策 Agent 综合分析多个来源,给出结构化建议
所有这些任务,没有一个需要用到 Claude Fable 5 的全能力量。系统的瓶颈从来不在模型能力上——而是在 Tool 设计得够不够好、Memory 管理得够不够稳定、错误处理得够不够健壮。
我花了大量时间优化的是中间这一层——Tool 的接口设计、Memory 的持久化策略、错误恢复逻辑、以及每次调用链路的可观测性。这些才是真正决定系统质量的因素。模型只要「够用」就行。
下次有新模型发布的时候,先问自己三个问题:
- 我的瓶颈真的是模型能力吗? ——还是需求没挖对、成本没控好、工程没做扎实?
- 换模型能解决我的什么问题? ——它会让用户感知到显著提升吗?
- 我的系统有足够好的可观测性吗? ——如果你不知道每次调用花在哪、错在哪,换模型就是盲人摸象。
模型在飞速进步,这是好事。但 90% 的日常任务已经越过了「够用」的基准线。 真正的差距,从来不在模型本身。
数据来源:OpenRouter API 实时定价、DeepSeek 官方发布公告(2026-04-24)、OpenAI GPT-5.6 官方公告(2026-07-09)、Anthropic Claude Fable 5 公告(2026-06-09)、RAND 企业 AI 项目元分析、AP News Kimi K3 报道。