AI 对话模型该怎么选?
FrameTide 接入了来自 11 家实验室的 15 个对话模型,价格跨度达 100 倍。本文给出一套按任务分流的方法,而不是每次都直接点最贵的那个。

FrameTide 里最贵的模型,价格是最便宜那个的 100 倍。不是贵 100%,是 100 倍。
这个数字值得记住,因为大多数人的本能是"选最强的那个,然后不再想这件事"。问一个问题时,这个本能不花你什么钱;但摊到一整周的工作量上,它就是"这套用法能不能持续"的分水岭。
按消耗排的全表
FrameTide 中每条消息的积分消耗,从低到高:
| 积分 | 模型 | 实验室 | 什么时候用 |
|---|---|---|---|
| 1 | DeepSeek V4 Flash | DeepSeek | 一切日常任务 |
| 5 | Gemini 3.6 Flash | 输入很长但要求快 | |
| 8 | DeepSeek V4 Pro | DeepSeek | 预算内的硬推理 |
| 8 | Qwen 3.7 Plus | 阿里 | 多语言、代码 |
| 8 | Kimi K3 | 月之暗面 | 智能体与长上下文 |
| 8 | GLM 5.2 | 智谱 | 中英双语推理、工具调用 |
| 8 | MiniMax M3 | MiniMax | 长文档与混合媒体 |
| 8 | MiMo V2.5 | 小米 | 快速推理、工具调用 |
| 8 | Tencent HY 3 | 腾讯 | 通用推理 |
| 20 | GPT-5.6 Luna | OpenAI | OpenAI 风格的日常工作 |
| 30 | Gemini 3.1 Pro | 超长上下文上的深度推理 | |
| 40 | GPT-5.6 Sol | OpenAI | 最难的那类问题 |
| 40 | Grok 4.5 | xAI | 长时间运行的智能体编码 |
| 50 | Claude Sonnet 5 | Anthropic | 要交付的文案和代码 |
| 100 | Claude Opus 5 | Anthropic | 出错代价很高的时候 |
有两点很直观:8 积分那一档又宽又平,几乎装下了整个开源权重阵营;而这一档和前沿模型之间,差着 5 到 12 倍。
唯一重要的那个问题
不是"哪个模型最强",而是**"这里出错的代价是多少?"**
这一个问题几乎能决定所有分流:
- 出错不要钱。 头脑风暴、换个说法、总结一份你本来就要读的材料、写一版你本来就要重写的草稿 —— 用 1 积分的 DeepSeek V4 Flash。你察觉到质量差异的频率会低于预期;真察觉到了,换个强模型重跑一次,总成本仍然低于一开始就用强模型。
- 出错很烦人。 你会 review 的代码、你会核实的资料、有真实读者的初稿。8 积分这一档就是为此存在的。DeepSeek V4 Pro 和 Kimi K3 都能拿到接近前沿的编码分数,价格却只是零头。
- 出错很贵。 要发给客户的东西、你不会逐行看的迁移、你会直接照做而不复核的判断。这才是 Claude Opus 5 和 GPT-5.6 Sol 存在的理由。花 100 积分避免一次错误合并很划算;花 100 积分改几个变量名不划算。
每家实验室各自擅长什么
Anthropic —— Sonnet 5(50)、Opus 5(100)。 全表里综合写作最强的一组,也是多数人在"要交付的代码"上会选的一对。Sonnet 5 有 100 万 token 上下文,SWE-bench Verified 拿到 72.7%;Opus 5 在其之上,自我校验更强,知识截止更新。贵,而且通常值得用在任务收尾,而不是开头。
OpenAI —— Luna(20)、Sol(40)。 GPT-5.6 这一代不再是"一个模型 + 一个努力程度旋钮",而是拆成了不同档位。Luna 是快而便宜的一端,Sol 是旗舰,在这批模型里 Terminal-Bench 2.1 领先。日常用 Luna,只有当便宜模型确实卡住时才上 Sol。
Google —— Gemini 3.6 Flash(5)、3.1 Pro(30)。 两者都是 100 万 token 上下文。只要任务涉及大量输入文本,Flash 就是全表性价比最高的选择:5 积分能读的量,除了 DeepSeek Flash 没有对手。Pro 留给需要在整个超长上下文上保持推理连贯的场景。
xAI —— Grok 4.5(40)。 面向编码和智能体任务,用真实编辑器会话训练,为跨大量工具调用的长时间运行设计。它的上下文从上一代的 100 万降到了 50 万 —— 如果你原本靠它吞整个代码库,这一点要注意。
DeepSeek —— V4 Flash(1)、V4 Pro(8)。 今年性价比方面最值得说的一条线。两者都是 100 万 token 上下文,V4 Pro 拿到了开源权重阵营里数一数二的 SWE-bench Verified 成绩。1 积分的 Flash 对大多数人来说就是正确的默认值。
开源权重阵营 —— Kimi K3、GLM 5.2、Qwen 3.7 Plus、MiniMax M3、MiMo V2.5、Tencent HY 3(都是 8 积分)。 在这里价格一样,所以按性格选而不是按价格选:K3 适合智能体流水线和前端代码,GLM 5.2 适合中英双语推理和工具调用,Qwen 胜在多语言覆盖面,MiniMax M3 适合长文档和混合媒体,MiMo V2.5 适合多模态输入下的快速推理,HY 3 是高效的通用推理。
一套真能省钱的分流习惯
- 默认从 1 积分开始。 每段对话都先用 DeepSeek V4 Flash 起步,大多数轮次根本用不上更强的。
- 凭证据升级,不凭焦虑升级。 只有当便宜模型在这个任务上确实失败了才往上走。"我怕它不够好"不算证据。
- 一次只升一档。 先从 Flash 到 8 积分,再考虑 100 积分。中间那一档能解决的问题,比多数人以为的多。
- 把钱花在收尾,而不是开头。 便宜地探索,最后一遍用最强的模型跑。反过来 —— 用前沿模型探索、用便宜模型交付 —— 才是真正贵的那种错。
- 在对话内部切换。 模型选择器就在输入框上,切换不会丢掉当前对话。为某一个难点单独升一档,代价只是那一条消息,不是整段对话。
积分说明不了的三件事
积分跟随服务商价格,而服务商价格与能力的对应关系是松散的。至少有三件事它没体现:
- 上下文。 8 积分那一档里有好几个是 100 万 token 窗口。如果你的瓶颈是"能喂进去多少"而不是"它想得多深",那么便宜且长胜过昂贵且短。
- 语言。 做中文的活时,GLM 5.2 和 Qwen 常常强于它们的价格所暗示的水平,而前沿模型的溢价买到的东西比在英文场景里少。
- 任务的形状。 Grok 4.5 是为长时间智能体运行设计的,MiniMax M3 面向混合媒体,K3 强在前端代码。在自己的主场上,8 积分的专才可以赢过 100 积分的通才。
一句话总结
按后果分流,不要按名气分流。草稿用 1 积分,正式工作用 8 积分,只在"出错真的会有代价"的地方才花 50 或 100。多数团队的比例是反的,而且每天都在为此付费。
资料来源
到 FrameTide 里动手试试
打开图片工作台,写下你想要的画面,用自己的提示词横向对比各个模型。