同一周,两件相反的事
最近一次头部厂商的发布会上,一天之内释放了两个相反的信号。
一边是旗舰模型因安全审查未通过而推迟发布:官方称内部测试中出现了欺骗行为和未经授权的任务执行,此前该模型也因安全问题受到多方批评。能力最强的那个模型,被自家安全团队按住了。
另一边是中端模型如期发布,主打"接近旗舰的能力、更低的价格"。
这两件事放在一起看,意思很直白:能力竞赛撞墙了,成本竞赛开打了。 对做AI产品的开发者来说,第二个信号比第一个重要得多。
一、先看清楚定价规则再谈体验
不同档位的模型,常见定价结构长这样(这里只讲结构,不写具体报价):
| 档位 | 定位 | 特点 |
|---|---|---|
| 旗舰 | 最强能力 | 最贵,适合复杂长链推理 |
| 中端 | 主力生产 | 能力接近旗舰,价格显著更低 |
| 轻量 | 简单任务 | 极便宜,适合分类、改写、抽取 |
除了标准价,还有三个容易忽略的细节:
- 批处理/弹性档:通常打到五折,适合非实时任务
- 快速档:价格翻倍,换更低的延迟
- 超长上下文:超过阈值后,整个请求按高档位计费
还有一点务必注意:新模型的低价往往是"促销价",有明确的有效期。 到期后政策不确定,成本模型要按标准价再算一遍。
二、性能:厂商自测的数据,先打个折再看
发布会上的数字通常很漂亮:接近旗舰的能力、更低的单任务成本、更高的基准分。
但这些多为厂商自己跑的发布评测,模型刚上线,独立复现还没有。
我的经验是:发布日的benchmark看看方向就好。真正决定换不换模型的,是自己业务场景跑一周的实际账单和效果。
三、长上下文陷阱,方向反了但坑还在
前面说过"整档计费"的悬崖:超过阈值后,整个请求按高价档计费,而不是只算超出的部分。
这一点在降价的中端模型上同样存在。做Agent的都懂,一个带完整仓库上下文、十几轮工具调用的会话,冲到阈值以上是家常便饭。你以为省了大部分的钱,超线一次就可能全还回去。
所以部署前加一道检查:请求上下文接近阈值就截断、分块,或者切到长上下文档位,别让一次超线吃掉降价的全部红利。
四、真实账单测算:一个AI产品能省多少
用一个典型场景来感受差距(只给结构,具体倍数取决于你的实际单价):
- 单次请求输入 8000 token(其中约 7000 是稳定的系统提示词和工具定义)
- 输出 1000 token
- 月请求量 10 万次
把同一套请求从中端模型换到旗舰模型、或者反过来,单次成本能差出数倍,月成本就是几千到上万量级的差距。对月成本还在几千元的产品来说,这差的不是一点成本,是这条业务线做不做得下去。
五、三个实操杠杆,按优先级排
第一,缓存是最大的杠杆。 稳定不变的内容(系统提示词、工具schema、知识库片段)要放在请求前缀,让缓存稳定命中。缓存价通常是标准输入价的一个小零头,命中与否,账单能差出几倍。
第二,非实时任务全部走批处理。 内容批量生成、数据清洗、报表摘要这类不需要秒回的活儿,直接打五折。AI产品里能批处理的任务占比通常不低,这一刀下去成本结构完全不同。
第三,模型路由别停。 简单任务丢给轻量模型,主力生产用中端模型,只有真正复杂的长链推理才值得上旗舰。这不是省钱抠门,是工程常识:让每个请求走刚好够用的档位。
六、社区的冷水也值得听
新模型发布后,技术社区的评论往往并不客气:有人质疑它就是此前泄漏的某个中间检查点改名上市,也有人直言"token价格已是唯一的战场,模型没有护城河了"。
这话难听,但对开发者反而是好消息。护城河不存在,意味着你永远可以"用脚投票":这个月用便宜的,下个月谁的性价比高就切过去,成本敏感的活儿扔给最便宜的模型。
一周之内:旗舰跳票、中端降价、竞品加量不加价、国产模型继续在成本端施压。几条线指向同一个结论:用AI做产品的门槛,在成本维度上又降了一截。
七、我的行动清单
- 本周把生产环境主力模型切到新的中端档位,跑一周实际账单对比,用数据说话
- 检查所有请求的prompt结构,确保系统提示词和工具定义稳定命中缓存
- 把批处理任务迁到批处理接口,按折扣重新核算产品定价
- 促销价到期前,按标准价把成本模型重算一遍,确认还站得住
写在最后
旗舰因安全问题不敢发,中端靠降价抢市场——这给开发者上了一课:能力上限暂时封顶,成本下限还在塌方。
对独立开发者来说,这可能是最好的局面:你不需要最强的模型,你需要的是把便宜的模型用出最高性价比。
账单不会说谎。先算清楚单次请求成本,再谈怎么把AI用出性价比。
我是王小听,一个15年Java架构师,正在用AI探索更多可能性。如果你在模型选型或成本优化上有实际经验,欢迎留言交流。