8 积分那一档:七个开源模型,同一个价
DeepSeek V4 Pro、Kimi K3、GLM 5.2、Qwen 3.7 Plus、MiniMax M3、MiMo V2.5 和腾讯 HY 3 在 FrameTide 里是同一个价。价格相同的时候,就该按性格来选。

FrameTide 里有七个模型,每条消息都正好 8 积分。它们来自七家不同的实验室,多数开放权重,其中好几个的跑分放在一年前都算前沿水平。
价格完全相同的时候,常规的对比方式就失效了。你不是在问"哪个更划算"—— 它们一样划算。你是在问哪一个的形状和你的问题对得上。
七个模型
| 模型 | 实验室 | 特点 | 上下文 |
|---|---|---|---|
| DeepSeek V4 Pro | DeepSeek | 1.6T MoE,激活 49B | 100 万 |
| Kimi K3 | 月之暗面 | 2.8T,迄今最大的开源权重发布 | 100 万 |
| GLM 5.2 | 智谱 | 744B MoE / 激活 40B,MIT | 100 万 |
| Qwen 3.7 Plus | 阿里 | 多语言覆盖面最广 | — |
| MiniMax M3 | MiniMax | 长上下文、混合媒体 | — |
| MiMo V2.5 | 小米 | 310B,原生全模态 | 105 万 |
| Tencent HY 3 | 腾讯 | 295B MoE / 激活 21B,Apache-2.0 | 25.6 万 |
其中三个在 8 积分的价位上带 100 万 token 上下文。这是整张表里最被低估的一条事实 —— 它意味着"便宜"和"能读很多"不再是对立的。
每个各自适合什么
DeepSeek V4 Pro —— 性价比的标杆。1.6T 的专家混合架构,每 token 激活 49B,2026 年 4 月 24 日与我们默认使用的 1 积分 V4 Flash 一同发布。它的 SWE-bench Verified 成绩在开源权重阵营里数一数二。如果你只想在这一档里定一个"硬推理默认值",就从它开始。
Kimi K3 —— 智能体专才。月之暗面 2026 年 7 月 16 日公布,十天后放出完整的 2.8T 权重,是迄今体量最大的开源权重发布。它在前端代码这一项上领跑开源模型,并且是为长工具调用链路设计的。当任务是一条序列而不是一个问题时,用它。
GLM 5.2 —— 中英双语推理。744B MoE、激活 40B,MIT 许可,在开源模型智能排行上长期靠前。工具调用强,中文推理尤其强 —— 在这一项上它经常压过价格数倍于它的模型。
Qwen 3.7 Plus —— 多语言通才。阿里这条线在这组里语言覆盖面最广。如果你的工作跨越的不是两种而是好几种语言,它是稳妥的选择。
MiniMax M3 —— 长输入与混合媒体。MiniMax 的专长是"喂给模型的是长文档、音频、视频,而不是短提示词"这类流程。输入又大又杂的时候选它。
MiMo V2.5 —— 原生全模态。2026 年 4 月 22 日发布,310B,MIT 许可,约 105 万上下文,原生支持音频、图像和视频输入。小米把它作为自家设备生态背后的模型,这一点体现在它偏向快速、实用的回答风格上。
Tencent HY 3 —— 效率路线。295B 专家混合,每 token 只激活 21B,Apache-2.0 许可,2026 年 7 月 6 日发布。上下文是这里最小的(25.6 万),但以其激活参数量而言通用推理能力相当强,在图像、3D 和视频相关任务上表现尤其突出。
不用七个都试也能选
按输入的形状和输出的形状分流:
- 长输入、要一个答案 → Kimi K3、DeepSeek V4 Pro 或 GLM 5.2,用它们的 100 万上下文。如果推理是局部的,直接降到 5 积分的 Gemini 3.6 Flash。
- 输入是混合媒体 → MiniMax M3 或 MiMo V2.5。
- 中文推理 → 先 GLM 5.2,其次 Qwen。
- 多语种 → Qwen 3.7 Plus。
- 长工具调用链 → Kimi K3。
- 你会 review 的硬核代码 → DeepSeek V4 Pro。
- 没有明确信号 → DeepSeek V4 Pro,它是七个里最通用的。
为什么这一档比前沿更值得关注
这一档和 50–100 积分之间差了 6 到 12 倍。能力差距确实存在,但比价格差距小得多,而且集中在几个未必是你痛点的地方:文字质感、面对模糊问题时的判断力,以及在很长且无人复核的输出上保持准确。
对于你反正都会读一遍的工作 —— 也就是大部分工作 —— 8 积分这一档才是合理的默认值。前沿模型的价格是在任务收尾时、在没人会去检查的那部分上赚回来的。
一个诚实的补充:这七个模型没有一个在绝对意义上是"某项最强"。它们是在几乎所有事情上最划算,这是另一种属性,而且通常更有用。
值得跑一次的测试
拿五个真实任务。每个都在 8 积分的 DeepSeek V4 Pro 和你平时会用的那个 50 或 100 积分模型上各跑一遍,然后盲评这五组。
多数团队会发现:贵的那个在五组里只有一两组明显胜出,而且这一两组有共同特征 —— 通常是"没人会认真读产出"或者"答案是判断而不是事实"。这个特征就是你的升级规则。其余的活可以永久留在 8 积分。
一句话总结
七个模型,一个价格,七种形状。默认用 DeepSeek V4 Pro;智能体链路换 K3,中文换 GLM 5.2,多语种换 Qwen,输入不是文字就换 MiniMax 或 MiMo。然后把 50 积分的模型只花在"你本来不会去检查答案"的地方。
资料来源
用 DeepSeek V4 Pro 开始创作
打开 FrameTide 创作助手时会自动选中 DeepSeek V4 Pro,可以直接处理自己的创作任务。