选模型:10 家平台全维度对比与选购指南
选模型:10 家平台,一张图比到底
本页回答「用谁家的模型」:先做 8 个维度的横向对比,再按需求与预算落到具体一家,最后算清订阅与 API 哪种更划算。
主流 API 全维度对比:10 家平台最新旗舰
对比口径统一为「各平台当前最新的旗舰模型」,逐个指标给出图表。价格为每百万 Token,美元按约 1 : 7.2 折算为人民币;核对日 2026-09-14。
十家平台最新旗舰一览
来源:价格:各平台官网公开价 · 核对日 2026-09-14
| 平台 | 最新旗舰模型 | 输入 / 百万 Token | 输出 / 百万 Token | 上下文 | 最强项 | 订阅版月费 |
|---|---|---|---|---|---|---|
| ChatGPT(OpenAI) | GPT-5.6 Sol | $4 / ¥28.8 缓存命中 $0.40 | $20 / ¥144 | 1.05M | 综合推理、生态最全 | $20(约 ¥145) |
| Claude(Anthropic) | Claude Opus 5 | $5 / ¥36 缓存命中 $0.50 | $25 / ¥180 | 1M | 长文本、代码工程 | $20(约 ¥145) |
| Gemini(Google) | Gemini 3.1 Pro | $2 / ¥14.4 缓存命中 $0.20 | $12 / ¥86.4 | 1M | 多模态、谷歌生态 | $19.99(约 ¥145) |
| DeepSeek | V4.1 Flash 2026-09-10 发布 | $0.15 / ¥1.08 缓存命中 ¥0.02 | $0.60 / ¥4.32 | 1M | 超长上下文 + 超低缓存成本,跑 Agent 最划算 | 约 ¥49 起 |
| Kimi(月之暗面) | Kimi K3 | $3 / ¥21.6 缓存命中 $0.30 | $15 / ¥108 | 1M | 超长文档、图表识别 | 约 ¥699 |
| 豆包(字节跳动) | Doubao-Seed-2.1-Pro | $0.83 / ¥6 缓存命中 约 ¥1.2 | $4.17 / ¥30 | 256K | 中文、多模态、国内速度 | ¥68 / ¥200 / ¥500 |
| 通义千问(阿里云) | Qwen3.8-Max | $2 / ¥14.4 缓存命中 $0.29 | $6 / ¥43.2 | 1M | 综合均衡、企业级稳定 | ¥19 / ¥49 / ¥128 |
| 智谱(GLM) | GLM-5.3 | $1.40 / ¥10.1 缓存命中 $0.18 | $4.40 / ¥31.7 | 1M | 开源生态、数学推理 | ¥49 / ¥149 / ¥469 |
| Grok(xAI) | Grok 4.6 | $2 / ¥14.4 缓存命中 $0.30 | $6 / ¥43.2 | 500K | 实时信息、社交场景 | $30(约 ¥216) |
| MiniMax | MiniMax M3 | $0.30 / ¥2.16 | $1.20 / ¥8.64 | 1M | 极低价格、中文长文本 | — |
一、价格只反映「单位成本」,实际账单还要看缓存命中率与输出长度;二、Gemini 与 OpenAI 对超长输入有加价档(Gemini 超过 20 万 Token 输入价升至 $4 / 输出 $18;OpenAI 超过 27.2 万 Token 输入翻倍);三、API 费用随用量线性增长,订阅费是固定支出——取舍见本部分第 3 节;四、价格与档位会随时调整,请以厂商官网为准。
八维度动态对比图
下面把「价格 → 容量 → 能力 → 速度 → 总成本」拆成 8 个可切换的维度,外加一张按月用量估算的成本曲线。切换维度时图表会实时重绘,绿色永远是当前维度的最优值。
一、刻度口径写在每张图的左上角:跨数量级的指标(价格、首 Token 延迟)用对数刻度,其余用从 0 起的线性刻度——线性刻度下的柱子长度可以直接按比例心算,不要横向比较两张不同刻度的图。二、参与排名的平台数在维度之间并不相同:某些维度只有部分平台公开了同口径数据(例如缓存命中价、编程基准),缺数据的平台会被排除在该维度之外,并在图注里写明,避免拿不同口径的数字硬凑。
输入价格(单位:$ / 百万 Token)
未命中缓存时的标准输入价。最便宜与最贵相差约 33 倍,但实际账单还要看缓存命中率与输出长度。

| 平台 | 数值 |
|---|---|
| DeepSeek V4.1 Flash | $0.15 |
| MiniMax M3 | $0.30 |
| 豆包 Seed-2.1-Pro | $0.83 |
| GLM-5.3 | $1.40 |
| Gemini 3.1 Pro | $2.00 |
| Qwen3.8-Max | $2.00 |
| Grok 4.6 | $2.00 |
| Kimi K3 | $3.00 |
| GPT-5.6 Sol | $4.00 |
| Claude Opus 5 | $5.00 |
来源:取各平台官网公开价,核对日 2026-09-14;人民币按 1 : 7.2 折算为美元口径。
输出价格(单位:$ / 百万 Token)
输出价决定「长回答」的账单。写代码、写长文这类输出密集型任务,输出价的权重远高于输入价。

| 平台 | 数值 |
|---|---|
| DeepSeek V4.1 Flash | $0.60 |
| MiniMax M3 | $1.20 |
| 豆包 Seed-2.1-Pro | $4.17 |
| GLM-5.3 | $4.40 |
| Qwen3.8-Max | $6.00 |
| Grok 4.6 | $6.00 |
| Gemini 3.1 Pro | $12.00 |
| Kimi K3 | $15.00 |
| GPT-5.6 Sol | $20.00 |
| Claude Opus 5 | $25.00 |
来源:同输入价格表,核对日 2026-09-14。
缓存命中价(单位:$ / 百万 Token(输入侧))
这是跑 Agent 时最该看的数字:系统提示词、工具定义、代码库片段会被反复读取,命中的部分按此价计费。DeepSeek 与 Claude 在这一项相差约 167 倍。

| 平台 | 数值 |
|---|---|
| DeepSeek V4.1 Flash | $0.003 |
| 豆包 Seed-2.1-Pro | $0.17 |
| GLM-5.3 | $0.18 |
| Gemini 3.1 Pro | $0.20 |
| Qwen3.8-Max | $0.29 |
| Grok 4.6 | $0.30 |
| Kimi K3 | $0.30 |
| GPT-5.6 Sol | $0.40 |
| Claude Opus 5 | $0.50 |
来源:MiniMax M3 未公开缓存命中价,故不参与本项排名。其余为官网公开价,核对日 2026-09-14。
上下文窗口(单位:千 Token(K))
一次能「装进去」的信息量。八家已进入百万 Token 量级;可容纳不等于能用好,超长上下文末端的召回质量仍要单独实测。

| 平台 | 数值 |
|---|---|
| GPT-5.6 Sol | 1050 |
| Claude Opus 5 | 1000 |
| Gemini 3.1 Pro | 1000 |
| DeepSeek V4.1 Flash | 1000 |
| Kimi K3 | 1000 |
| Qwen3.8-Max | 1000 |
| GLM-5.3 | 1000 |
| MiniMax M3 | 1000 |
| Grok 4.6 | 500 |
| 豆包 Seed-2.1-Pro | 256 |
来源:各平台官网规格,核对日 2026-09-14。
综合智能指数(单位:分(同口径快照))
第三方模型库在同一口径下的质量分快照,用于快速判断「谁更聪明」。分差在 1 分以内基本可视为持平。

| 平台 | 数值 |
|---|---|
| Claude Opus 5 | 50.7 |
| GPT-5.6 Sol | 47.1 |
| Grok 4.6 | 44.4 |
| Kimi K3 | 43.8 |
| Qwen3.8-Max | 40.3 |
| DeepSeek V4.1 Flash | 39.5 |
| Gemini 3.1 Pro | 30.4 |
| MiniMax M3 | 29.6 |
来源:第三方模型库 2026-09-12 快照。豆包 Seed-2.1-Pro 与 GLM-5.3 未纳入该口径,故不在此项;Gemini 3.1 Pro 发布于 2026 年初,落后其余旗舰约半年,分数偏低不代表其多模态能力弱。
编程 Agent 能力(单位:DeepSWE v1.1 得分(%))
面向真实仓库级编程任务的基准。三家头部的分差在 1.5 分以内,属误差范围;真正的差距出现在更难的 Terminal-Bench 4.0 与 HLE 上。

| 平台 | 数值 |
|---|---|
| DeepSeek V4.1 Flash | 74.2% |
| Claude Opus 5 | 73.7% |
| GPT-5.6 Sol | 72.7% |
| Kimi K3 | 68.5% |
| Grok 4.6 | 67.5% |
| GLM-5.3 | 66.9% |
| Qwen3.8-Max | 57.5% |
来源:综合自公开技术报告与榜单,口径日 2026-09-11。豆包、Gemini、MiniMax 未列入同一榜单,故不在此项。
输出速度(单位:Token / 秒)
取低推理档位的稳态输出速度。高频批量生成(文案、翻译、结构化抽取)时,这一项直接决定单位时间的产出量。

| 平台 | 数值 |
|---|---|
| DeepSeek V4.1 Flash | 261 |
| Gemini 3.1 Pro | 125 |
| MiniMax M3 | 106 |
| Grok 4.6 | 71 |
| GPT-5.6 Sol | 69 |
| Claude Opus 5 | 61 |
| Qwen3.8-Max | 41 |
| Kimi K3 | 37 |
来源:第三方实测,核对日 2026-09-14;速度为近似值,会随服务端负载波动。
首 Token 延迟(单位:秒(越低越好))
从发出请求到看见第一个字的时间。该项取「最高推理档位」,即先想再答的思考时间都被计入;交互式场景请务必切到低推理档位,数字会下降一个数量级。

| 平台 | 数值 |
|---|---|
| MiniMax M3 | 0.83 |
| DeepSeek V4.1 Flash | 0.92 |
| Qwen3.8-Max | 1.80 |
| Kimi K3 | 2.99 |
| Gemini 3.1 Pro | 24.48 |
| Claude Opus 5 | 36.03 |
| Grok 4.6 | 38.01 |
| GPT-5.6 Sol | 124.83 |
来源:第三方实测,核对日 2026-09-14。
月成本曲线(按 4 : 1 的输入 / 输出比例估算)

用量越大,价差被放大的倍数越惊人:月用量 1000 万 Token 时,Claude Opus 5 约 $90、DeepSeek V4.1 Flash 约 $2.4;月用量涨到 10 亿 Token(规模化挂机跑 Agent 的量级),差距拉大到 $9000 对 $240。而缓存命中折扣会把这条绿线再压低一个数量级——这也是「跑 Agent 该选谁」的关键论据。
展开精确数值表(6 家 × 5 档用量,单位:美元 / 月)
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 月用量 | DeepSeek V4.1 Flash | GLM-5.3 | Qwen3.8-Max | Gemini 3.1 Pro | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|---|
| 10 百万 | $2.4 | $20.0 | $28.0 | $40.0 | $72.0 | $90.0 |
| 50 百万 | $12.0 | $100 | $140 | $200 | $360 | $450 |
| 100 百万 | $24.0 | $200 | $280 | $400 | $720 | $900 |
| 500 百万 | $120 | $1,000 | $1,400 | $2,000 | $3,600 | $4,500 |
| 1000 百万 | $240 | $2,000 | $2,800 | $4,000 | $7,200 | $9,000 |
图注:估算口径:输入占 80%、输出占 20%,未计入缓存命中折扣与批量折扣,故实际账单通常低于表中数值。x 轴与 y 轴均为对数刻度,刻度线与数据点使用同一套映射,两端各留出余量以便看清最低与最高两条线。
DeepSeek V4.1 Flash 专项对比
它是 DeepSeek 的 Flash 系列新作,也是第一个采用因果编解码器(CED)架构的模型:把 40 层 Transformer 拆成 20 层编码器 + 20 层解码器,输入阶段激活 8B 参数、输出阶段激活 16B 参数,配合压缩稀疏注意力与 FP4 KV 缓存,把全局 KV 缓存压到每 Token 约 890 字节——约为上一代 V4-Flash 的四分之一。官方称其在性能、成本、速度与总耗时上全面超越 V4 Pro,并已开始有序下线 V4 Pro。
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 规格项 | 参数 | 说明 |
|---|---|---|
| 总参数量 | 552B(MoE) | 预填充阶段激活 8B、解码生成阶段激活 16B;另含约 196B 的稀疏条件记忆模块 |
| 架构 | CED 因果编解码器 | 20 层编码 + 20 层解码;压缩稀疏注意力 2 + 分层稀疏索引 + FP4 KV 缓存 |
| 上下文 | 1,048,576 Token | 约 78.6 万汉字;单次最大输出 384K Token |
| 多模态 | 支持图像输入 | 同时支持思考 / 非思考模式、JSON 输出、工具调用、前缀续写与 FIM 补全 |
| 开放程度 | MIT 许可、权重已开放 | 权重已在 Hugging Face 发布;但 552B 规模远超消费级 Mac 内存,本地跑不动,走 API 才是正确用法 |
| API 模型名 | deepseek-flash | 旧名 deepseek-v4-flash 仍可用,请求会被路由到本模型并按 Flash 价格计费 |
| V4 Pro 去向 | 2026-09-14 12<00>00> 起路由 | 北京时间 9 月 14 日中午起,deepseek-v4-pro 的请求全部转发到 V4.1 Flash,直至未来发布 V4.1 Pro |
价格对比:与当前主流旗舰同一口径(每百万 Token,美元)
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 模型 | 输入 | 输出 | 缓存命中读取 | 定位 |
|---|---|---|---|---|
| DeepSeek V4.1 Flash | $0.15 | $0.60 | $0.003 | 超长上下文 + 极低缓存成本,Agent 友好 |
| GPT-5.6 Sol | $4 | $20 | $0.40 | 通用旗舰,生态最全 |
| Claude Opus 5 | $5 | $25 | $0.50 | 长文本与代码工程旗舰 |
| Kimi K3 | $3 | $15 | $0.30 | 超长文档与图表识别 |
跑 Agent 时,系统提示词、工具定义、代码库片段与会话历史会被反复读取。按官方举例:一个 50 万 Token 的可复用前缀被 100 次请求复用,即 5000 万缓存输入 Token——在 V4.1 Flash 上约 $0.15,而同等用量在 Kimi K3 约 $15、GPT-5.6 Sol 约 $20、Claude Opus 5 约 $25。差距接近两个数量级,这也是它适合长时间挂着跑 Agent 的原因。
基准成绩(官方公布)
来源:基准测试:公开技术报告与第三方榜单 · 核对日 2026-09-14
| 基准 | V4.1 Flash | 对照 |
|---|---|---|
| GPQA Diamond | 90.9 | 研究生级科学问答,最高推理档位 |
| Humanity’s Last Exam | 36.8(纯文本) 63.9(可调用工具) | 通用难题集,带工具后提升明显 |
| DeepSWE v1.1 | 74.2 | 略高于 Claude Opus 5(74.0)与 GPT-5.6 Sol(73.0) |
一、高峰时段价格翻倍。 闲时价(上表)适用于非高峰时段;高峰时段为周一至周五 01<00>00>–04<00>00> 与 06<00>00>–10<00>00> UTC,对应北京时间 09<00>00>–12<00>00> 与 14<00>00>–18<00>00>——正好是国内工作时段,所以整段工作的成本要按 2 倍估算,而缓存命中价(高峰 $0.006)仍然是省钱的核心手段。二、新架构存在已知边界。 官方说明稀疏选择误差与近似状态重建可能在极端情况下影响能力,尤其在超长上下文的稀疏检索与缓存续传边界上,仍在补充压力测试。
API 费用随用量线性增长,订阅费为固定支出——两者的取舍见本部分第 3 节。表中除 DeepSeek V4.1 Flash 为新近公开资料外,其余价格与档位沿用原文数据;全部条目以 2026-09-14 为准,会随时调整,请以厂商官网为准。
各平台适合谁、擅长什么
按「谁适合用」与「最擅长什么」两条线,快速定位该选哪家。卡片中的模型名与本部分第 1 节保持同一口径(核对日 2026-09-14)。
按需求找平台
先说你最常干的事,再落到具体平台。每个需求给出首选与备选,并同时写明「要留意」的部分——没有一家是全能选手。
读长文档 / 写论文
这一需求下值得先试的平台,按推荐顺序排列:
来源:价格:各平台官网公开价 · 核对日 2026-09-14
| 平台 | 为什么选它 | 要留意 |
|---|---|---|
| 首选 Kimi K3 | 超长文档阅读与总结,整本书、几十篇论文可一次丢入;PDF 图表与公式识别准。 | 1M 上下文,但输出价 $15 / 百万,长回答成本偏高 |
| 备选 Claude Opus 5 | 长文本严谨推理,合同、财报、法律文书分析稳。 | 单价最高,适合项目制而非日常刷量 |
| 备选 DeepSeek V4.1 Flash | 1M 上下文 + 缓存命中价 $0.003,批量读同一批资料时最省。 | 极端长文末端的召回质量仍需自己实测 |
编程与代码工程
这一需求下值得先试的平台,按推荐顺序排列:
来源:基准测试:公开技术报告与第三方榜单 · 核对日 2026-09-14
| 平台 | 为什么选它 | 要留意 |
|---|---|---|
| 首选 Claude Opus 5 | 代码工程能力极强,配合 Claude Code 可端到端交付。 | Claude Code 是独立产品,需单独装 |
| 备选 DeepSeek V4.1 Flash | DeepSWE v1.1 得分 74.2,当前公开榜单第一,且单价最低。 | 复杂重构仍建议人工复核 |
| 备选 GPT-5.6 Sol | 生态最全,插件与 Agent 工具链最完善。 | 首 Token 延迟最高(124.83s,最高推理档) |
中文写作与日常办公
这一需求下值得先试的平台,按推荐顺序排列:
来源:价格:各平台官网公开价 · 核对日 2026-09-14
| 平台 | 为什么选它 | 要留意 |
|---|---|---|
| 首选 豆包 Seed-2.1-Pro | 中文理解与国内生活场景适配最好,国内访问速度快。 | 上下文 256K,是十家里最小的 |
| 备选 Qwen3.8-Max | 综合均衡、企业级稳定,阿里云生态集成顺。 | 输出价 $6 / 百万,中档偏上 |
| 备选 DeepSeek V4.1 Flash | 中文论文润色、数学推理强,成本极低。 | 高峰时段价格翻倍,注意错峰 |
多模态(图 / 视频 / 语音)
这一需求下值得先试的平台,按推荐顺序排列:
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 平台 | 为什么选它 | 要留意 |
|---|---|---|
| 首选 Gemini 3.1 Pro | 原生多模态架构,视频理解领先,Workspace 深度集成。 | 发布较早,纯文本推理分数偏低 |
| 备选 豆包 Seed-2.1-Pro | 图片、视频、语音能力全面,国内速度好。 | 部分能力需走火山方舟特定接口 |
| 备选 MiniMax M3 | 同价位里语音与视频生成能力突出,单价极低。 | 文本推理不是它的强项 |
极致省成本
这一需求下值得先试的平台,按推荐顺序排列:
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 平台 | 为什么选它 | 要留意 |
|---|---|---|
| 首选 DeepSeek V4.1 Flash | 输入 $0.15 / 输出 $0.60,缓存命中 $0.003,Agent 场景无人能敌。 | 高峰时段(北京时间 09–12、14–18)翻倍 |
| 备选 MiniMax M3 | 输入 $0.30 / 输出 $1.20,是主流旗舰的十分之一量级。 | 未公开缓存命中价 |
| 备选 GLM-5.3 | 开源生态完善,可本地部署进一步压掉边际成本。 | 自建要算电费与运维 |
实时信息与舆情
这一需求下值得先试的平台,按推荐顺序排列:
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 平台 | 为什么选它 | 要留意 |
|---|---|---|
| 首选 Grok 4.6 | 实时检索与热点追踪,与 X 平台生态深度联动。 | 上下文 500K,弱于头部 |
| 备选 GPT-5.6 Sol | 综合推理最强兜底,可自行组合联网工具。 | 自带实时性弱于 Grok |
私有化 / 本地部署
这一需求下值得先试的平台,按推荐顺序排列:
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 平台 | 为什么选它 | 要留意 |
|---|---|---|
| 首选 GLM-5.3 | 开源可微调,支持私有化部署,数据安全可控。 | 需要自己承担运维 |
| 备选 Qwen3.8-Max | 开源模型生态完善,本地与云上可同一套代码。 | 本地小尺寸版本能力会下降 |
企业级稳定与生态
这一需求下值得先试的平台,按推荐顺序排列:
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 平台 | 为什么选它 | 要留意 |
|---|---|---|
| 首选 Qwen3.8-Max | 企业级 SLA 与阿里云服务深度集成,稳定性优先。 | 创新速度不如海外旗舰 |
| 备选 GPT-5.6 Sol | 插件与 Agent 生态最丰富,工具链最完善。 | 国内直连需自备通道 |
| 备选 Claude Opus 5 | 长文本 + 代码工程双强,适合交付型团队。 | 价格最高一档 |
平台档案
下面按平台逐一给出完整画像:适合谁、最擅长什么、控制台入口。
🌙 Kimi K3
月之暗面 · API 控制台
适合: 科研人员、研究生、文献工作者,以及需要批量处理长文档的人。
最擅长:
- 超长文档阅读与总结,整本书 / 几十篇论文可直接丢入
- PDF 图表、公式、数据精准识别与提取
- 文献综述、对比分析、研究方法梳理
🔮 DeepSeek V4.1 Flash
适合: 学生、中文写作者、程序员、预算敏感的科研用户,以及需要超长上下文又在意成本的团队。
最擅长:
- 超长上下文:100 万 Token(约 78.6 万汉字),整本书或整套文档可一次丢入
- 成本极低:闲时输入 ¥1.08 / 百万 Token,缓存命中读取仅 ¥0.02 / 百万
- 中文论文润色、数学推理、代码生成,理工科友好,DeepSWE v1.1 得分 74.2
- 原生支持图像输入与工具调用,适合长时间跑 Agent 流水线
🤖 OpenAI / ChatGPT
GPT-5.6 Sol · API 控制台
适合: 开发者、重度通用用户、需要插件生态、追求稳定性的人。
最擅长:
- 通用推理、多模态处理、复杂综合任务兜底
- 插件与 Agent 生态最丰富,工具链最完善
- 多语言、跨领域知识覆盖面最广
🧠 Anthropic Claude
Claude Opus 5 / Claude Code · API 控制台
适合: 程序员、法律与金融从业者、长文本处理专业人士。
最擅长:
- 超长上下文严谨推理,代码工程能力极强
- Claude Code 终端自主开发,端到端交付任务
- 合同、财报、法律文书等专业长文档分析
💎 Google Gemini
Gemini 3.1 Pro · AI Studio
适合: 谷歌生态用户、有多模态需求者、科研工作者。
最擅长:
- 原生多模态架构,视频理解领先
- Google Workspace 深度集成,办公协同顺畅
- 百万级超长上下文,适合大项目分析
🫘 字节跳动 豆包
Doubao-Seed-2.1-Pro · 火山方舟控制台
适合: 国内普通用户、内容创作者、中文办公人群。
最擅长:
- 中文理解与生成,国内生活场景适配最好
- 多模态生成,图片、视频、语音能力全面
- 国内访问速度快,稳定不卡顿
🐑 阿里云 通义千问
Qwen3.8-Max · 百炼控制台
适合: 企业用户、开发者、阿里云生态用户。
最擅长:
- 综合能力均衡,企业级稳定可靠
- 开源模型生态完善,可本地部署
- 阿里云服务深度集成
🌟 智谱 AI GLM
GLM-5.3 · 开放平台
适合: 开源开发者,以及有本地化部署需求的企业 / 个人。
最擅长:
- 开源模型生态完善,可本地部署、微调
- 数学推理能力突出,理工科友好
- 支持私有化部署,数据安全可控
🚀 Grok(xAI)
Grok 4.6 · xAI 平台
适合: 需要实时信息、社交舆情与口语化表达的人。
最擅长:
- 实时信息检索与热点追踪,时效性突出
- 社交场景与短文本创作,语气自然
- 与 X 平台生态深度联动
🧩 MiniMax
MiniMax M3 · 开放平台
适合: 预算极紧、又需要长上下文与多模态输出的个人与小团队。
最擅长:
- 单价极低,输入价约为主流旗舰的 1/10
- 中文长文本处理,百万级上下文
- 语音与视频生成能力在同价位中突出
自己跑一遍再选型:A/B 测评模板
前面所有维度都是别人测出来的。真正决定选谁,要用你自己的任务跑一遍——同一批输入、同一份 prompt,只换模型。下面是一份能直接改的最小模板。
| 要记录的字段 | 怎么取 | 为什么值得记 |
|---|---|---|
| 是否通过 | 用规则或人工给每条输出打 0 / 1(能自动校验的用断言,不能的抽样人工看) | 这是唯一真正重要的指标:通过率决定这套流程能不能上线 |
| 首 Token 延迟 | 发起请求到收到第一个字的时间 | 交互式场景的体感上限;批量场景可以忽略 |
| 总耗时 | 从发起到收完 | 换算成「每小时能处理多少条」 |
| 输入 / 输出 token | 响应里的 usage 字段 | 乘上单价就是单条成本,能直接对上成本曲线 |
| 失败与重试次数 | 记录错误码与重试轮数 | 稳定性差一个数量级,运维成本差一个数量级 |
| 人工接管次数 | 统计「你必须动手改才可用」的比例 | 这是隐形成本的大头,也是便宜模型最容易踩的坑 |
# ab_test.py:同一批任务打 3 家,输出一张可对比的 CSVimport csv, os, timefrom providers import build_client # 自己封一层,屏蔽各家 SDK 差异
CASES = [line.strip() for line in open("cases.txt", encoding="utf-8") if line.strip()]MODELS = ["deepseek-v4.1-flash", "gpt-5.6-sol", "claude-opus-5"]ROWS = []
for name in MODELS: client = build_client(name) for i, case in enumerate(CASES, 1): t0 = time.time(); first = None; usage = {} try: for chunk in client.stream(case): if first is None: first = time.time() - t0 usage = chunk.usage or usage ok = verify(case, chunk.text) # 自动校验,返回 0/1 except Exception as e: ok, first = 0, None ROWS.append({"model": name, "case": i, "pass": ok, "ttft": first, "total": time.time() - t0, "in": usage.get("in"), "out": usage.get("out")})
with open("result.csv", "w", newline="", encoding="utf-8") as f: w = csv.DictWriter(f, fieldnames=ROWS[0].keys()); w.writeheader(); w.writerows(ROWS)
# 汇总:通过率 / 平均耗时 / 单条成本for name in MODELS: r = [x for x in ROWS if x["model"] == name] pass_rate = sum(x["pass"] for x in r) / len(r) print(f"{name}: 通过率 {pass_rate:.0%}"口径:样本量建议至少 30 条真实任务,且要覆盖你日常的难点(不是挑最简单的例子);低于 20 条时通过率的置信区间会宽到没有区分度。多跑一轮换一批输入的结论,比在同一批上反复调 prompt 更可靠。「最强」「最擅长」「最适合」这类判断都只是在这套测评下的相对结论,不构成对任何平台的绝对评价。
本节口径:一、「按需求找平台」里的首选 / 备选是依据本页 1.2 的八个维度与本页表格中的能力描述综合排序的结果,不是评测结论,同档位平台互换通常也不会出错。二、「平台档案」里的一句话定位 / 最强项 / 最适合 / 要留意是编辑归纳,来源为各平台官方文档与公开评测,核对日 2026-09-14;这类判断带主观成分,请以你自己的任务实测为准(可用 2.3 的 A/B 模板)。
订阅还是 API:分平台选购指南
判断标准只有两条:用量是否稳定、是给自己用还是给程序用。
选订阅: 每天都用、用量稳定且偏大,主要是手动聊天 / 写代码 / 日常答疑。选 API: 用量波动大、需要批量处理文档数据、跑 Agent 自动化、接入自己的程序。
分平台对照
判断标准只有两条:用量是否稳定、是给自己用还是给程序用。下面按平台逐个对照。
DeepSeek V4.1 Flash
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
每天都用、月用量稳定在 300 万 Token 以上;主要手动聊天、写代码、日常答疑。注意高峰期(北京时间 09<00>00>–12<00>00>、14<00>00>–18<00>00>)API 价格翻倍,重度白天使用者可考虑订阅
⚡ 适合选 API
用量波动大、批量处理文档 / 数据、跑 Agent 自动化、接入自己的程序;月用量低于 200 万 Token 时 API 便宜很多,且系统提示词与工具定义被反复读取时缓存命中价仅 ¥0.02 / 百万,跑 Agent 的成本优势最大
ChatGPT(OpenAI)
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
日常高频通用场景,需要插件、GPTs、高级语音视频功能;重度每日使用者
⚡ 适合选 API
开发应用、自动化工作流、批量处理、需要高并发调用;用量少的时候更划算
Claude(Anthropic)
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
天天读长文档、写代码、用 Claude Code;每月稳定高用量
⚡ 适合选 API
批量长文档处理、项目制工作流、接入第三方客户端;用量波动大
Google Gemini
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
谷歌全家桶用户、日常多模态需求、需要 Gemini Advanced 完整功能
⚡ 适合选 API
批量多模态处理、视频理解、谷歌云工作流;用量灵活
Kimi(月之暗面)
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
科研人员每天读论文、重度长文档用户;持续高频使用
⚡ 适合选 API
阶段性批量处理文献、做文献综述、自动化解析 PDF;不用时零成本
字节豆包
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
国内日常办公、内容创作、经常用专家模式;固定月费省心
⚡ 适合选 API
批量内容生产、电商客服、自动化运营;接入自己的业务系统
通义千问(阿里云)
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
阿里云用户、企业日常办公、用量稳定
⚡ 适合选 API
企业级集成、工作流自动化、结合云服务部署;按量计费更灵活
智谱 GLM
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
日常高频使用、数学推理、需要完整模型权限
⚡ 适合选 API
开发者、本地部署 + 云端混合、定制化业务集成;开源生态适配
Grok(xAI)
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
需要实时信息与社交舆情、且习惯 X 平台生态的重度用户
⚡ 适合选 API
把实时检索接进自动化流程、做舆情监控与热点选题;用量弹性大
MiniMax
同一家平台,「订订阅」与「走 API」分别适合什么人:
✅ 适合选订阅
预算有限、以中文长文本与音视频生成为主的个人用户
⚡ 适合选 API
大批量低价推理、长文档处理、语音与视频生成流水线
Claude Code 专项说明
它不是独立 API,而是 Anthropic 官方推出的终端 AI 编程助手,一个基于 Claude API 的客户端 Agent 工具。官网 claude.com/product/claude-code · 文档 docs.claude.com/claude-code
核心能力
- 直接读取整个代码库,理解项目架构
- 自主执行多步开发任务,端到端交付
- 原生支持终端命令、Git 操作、运行测试
- 200K 上下文,可覆盖中型完整项目
价格与横向对比
- Max 订阅 $20 / 月,含额度,超量部分走 API 计费
- 也可以绑定自己的 API Key,按量付费
- 对比 Cursor:更擅长自主任务,定位偏「工程助理」
- 对比 Codex:纯终端形态,更极客,支持多模型
接下来:模型选完,还有一条完全不同的路线:把模型搬到本机跑。它换来的不是更强的能力,而是「数据不出门」与「零边际成本」——代价是硬件投入与运维时间。
本文档仅供个人学习与研究使用, 不得用于商业用途 ,亦不构成任何收益承诺。
支持与分享
如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!














