视频加载失败

选模型:10 家平台全维度对比与选购指南

7233 字
36 分钟
选模型:10 家平台全维度对比与选购指南

选模型:10 家平台,一张图比到底#

本页回答「用谁家的模型」:先做 8 个维度的横向对比,再按需求与预算落到具体一家,最后算清订阅与 API 哪种更划算。

主流 API 全维度对比:10 家平台最新旗舰#

对比口径统一为「各平台当前最新的旗舰模型」,逐个指标给出图表。价格为每百万 Token,美元按约 1 : 7.2 折算为人民币;核对日 2026-09-14。

十家平台最新旗舰一览#

来源:价格:各平台官网公开价 · 核对日 2026-09-14

平台最新旗舰模型输入 / 百万 Token输出 / 百万 Token上下文最强项订阅版月费
ChatGPT(OpenAI)GPT-5.6 Sol$4 / ¥28.8 缓存命中 $0.40$20 / ¥1441.05M综合推理、生态最全$20(约 ¥145)
Claude(Anthropic)Claude Opus 5$5 / ¥36 缓存命中 $0.50$25 / ¥1801M长文本、代码工程$20(约 ¥145)
Gemini(Google)Gemini 3.1 Pro$2 / ¥14.4 缓存命中 $0.20$12 / ¥86.41M多模态、谷歌生态$19.99(约 ¥145)
DeepSeekV4.1 Flash 2026-09-10 发布$0.15 / ¥1.08 缓存命中 ¥0.02$0.60 / ¥4.321M超长上下文 + 超低缓存成本,跑 Agent 最划算约 ¥49 起
Kimi(月之暗面)Kimi K3$3 / ¥21.6 缓存命中 $0.30$15 / ¥1081M超长文档、图表识别约 ¥699
豆包(字节跳动)Doubao-Seed-2.1-Pro$0.83 / ¥6 缓存命中 约 ¥1.2$4.17 / ¥30256K中文、多模态、国内速度¥68 / ¥200 / ¥500
通义千问(阿里云)Qwen3.8-Max$2 / ¥14.4 缓存命中 $0.29$6 / ¥43.21M综合均衡、企业级稳定¥19 / ¥49 / ¥128
智谱(GLM)GLM-5.3$1.40 / ¥10.1 缓存命中 $0.18$4.40 / ¥31.71M开源生态、数学推理¥49 / ¥149 / ¥469
Grok(xAI)Grok 4.6$2 / ¥14.4 缓存命中 $0.30$6 / ¥43.2500K实时信息、社交场景$30(约 ¥216)
MiniMaxMiniMax M3$0.30 / ¥2.16$1.20 / ¥8.641M极低价格、中文长文本
读表提示

一、价格只反映「单位成本」,实际账单还要看缓存命中率与输出长度;二、Gemini 与 OpenAI 对超长输入有加价档(Gemini 超过 20 万 Token 输入价升至 $4 / 输出 $18;OpenAI 超过 27.2 万 Token 输入翻倍);三、API 费用随用量线性增长,订阅费是固定支出——取舍见本部分第 3 节;四、价格与档位会随时调整,请以厂商官网为准。

八维度动态对比图#

下面把「价格 → 容量 → 能力 → 速度 → 总成本」拆成 8 个可切换的维度,外加一张按月用量估算的成本曲线。切换维度时图表会实时重绘,绿色永远是当前维度的最优值

两张图怎么读

一、刻度口径写在每张图的左上角:跨数量级的指标(价格、首 Token 延迟)用对数刻度,其余用从 0 起的线性刻度——线性刻度下的柱子长度可以直接按比例心算,不要横向比较两张不同刻度的图。二、参与排名的平台数在维度之间并不相同:某些维度只有部分平台公开了同口径数据(例如缓存命中价、编程基准),缺数据的平台会被排除在该维度之外,并在图注里写明,避免拿不同口径的数字硬凑。

输入价格(单位:$ / 百万 Token)#

未命中缓存时的标准输入价。最便宜与最贵相差约 33 倍,但实际账单还要看缓存命中率与输出长度。

输入价格对比(对数刻度 · 越短越便宜 · 绿色为最优)
输入价格对比(对数刻度 · 越短越便宜 · 绿色为最优)

平台数值
DeepSeek V4.1 Flash$0.15
MiniMax M3$0.30
豆包 Seed-2.1-Pro$0.83
GLM-5.3$1.40
Gemini 3.1 Pro$2.00
Qwen3.8-Max$2.00
Grok 4.6$2.00
Kimi K3$3.00
GPT-5.6 Sol$4.00
Claude Opus 5$5.00

来源:取各平台官网公开价,核对日 2026-09-14;人民币按 1 : 7.2 折算为美元口径。

输出价格(单位:$ / 百万 Token)#

输出价决定「长回答」的账单。写代码、写长文这类输出密集型任务,输出价的权重远高于输入价。

输出价格对比(对数刻度 · 绿色为最优)
输出价格对比(对数刻度 · 绿色为最优)

平台数值
DeepSeek V4.1 Flash$0.60
MiniMax M3$1.20
豆包 Seed-2.1-Pro$4.17
GLM-5.3$4.40
Qwen3.8-Max$6.00
Grok 4.6$6.00
Gemini 3.1 Pro$12.00
Kimi K3$15.00
GPT-5.6 Sol$20.00
Claude Opus 5$25.00

来源:同输入价格表,核对日 2026-09-14。

缓存命中价(单位:$ / 百万 Token(输入侧))#

这是跑 Agent 时最该看的数字:系统提示词、工具定义、代码库片段会被反复读取,命中的部分按此价计费。DeepSeek 与 Claude 在这一项相差约 167 倍。

缓存命中价对比(对数刻度 · 绿色为最优)
缓存命中价对比(对数刻度 · 绿色为最优)

平台数值
DeepSeek V4.1 Flash$0.003
豆包 Seed-2.1-Pro$0.17
GLM-5.3$0.18
Gemini 3.1 Pro$0.20
Qwen3.8-Max$0.29
Grok 4.6$0.30
Kimi K3$0.30
GPT-5.6 Sol$0.40
Claude Opus 5$0.50

来源:MiniMax M3 未公开缓存命中价,故不参与本项排名。其余为官网公开价,核对日 2026-09-14。

上下文窗口(单位:千 Token(K))#

一次能「装进去」的信息量。八家已进入百万 Token 量级;可容纳不等于能用好,超长上下文末端的召回质量仍要单独实测。

上下文窗口对比(线性刻度 · 绿色为最优)
上下文窗口对比(线性刻度 · 绿色为最优)

平台数值
GPT-5.6 Sol1050
Claude Opus 51000
Gemini 3.1 Pro1000
DeepSeek V4.1 Flash1000
Kimi K31000
Qwen3.8-Max1000
GLM-5.31000
MiniMax M31000
Grok 4.6500
豆包 Seed-2.1-Pro256

来源:各平台官网规格,核对日 2026-09-14。

综合智能指数(单位:分(同口径快照))#

第三方模型库在同一口径下的质量分快照,用于快速判断「谁更聪明」。分差在 1 分以内基本可视为持平。

综合智能指数对比(线性刻度 · 绿色为最优)
综合智能指数对比(线性刻度 · 绿色为最优)

平台数值
Claude Opus 550.7
GPT-5.6 Sol47.1
Grok 4.644.4
Kimi K343.8
Qwen3.8-Max40.3
DeepSeek V4.1 Flash39.5
Gemini 3.1 Pro30.4
MiniMax M329.6

来源:第三方模型库 2026-09-12 快照。豆包 Seed-2.1-Pro 与 GLM-5.3 未纳入该口径,故不在此项;Gemini 3.1 Pro 发布于 2026 年初,落后其余旗舰约半年,分数偏低不代表其多模态能力弱。

编程 Agent 能力(单位:DeepSWE v1.1 得分(%))#

面向真实仓库级编程任务的基准。三家头部的分差在 1.5 分以内,属误差范围;真正的差距出现在更难的 Terminal-Bench 4.0 与 HLE 上。

编程 Agent 能力对比(线性刻度 · 绿色为最优)
编程 Agent 能力对比(线性刻度 · 绿色为最优)

平台数值
DeepSeek V4.1 Flash74.2%
Claude Opus 573.7%
GPT-5.6 Sol72.7%
Kimi K368.5%
Grok 4.667.5%
GLM-5.366.9%
Qwen3.8-Max57.5%

来源:综合自公开技术报告与榜单,口径日 2026-09-11。豆包、Gemini、MiniMax 未列入同一榜单,故不在此项。

输出速度(单位:Token / 秒)#

取低推理档位的稳态输出速度。高频批量生成(文案、翻译、结构化抽取)时,这一项直接决定单位时间的产出量。

输出速度对比(线性刻度 · 绿色为最优)
输出速度对比(线性刻度 · 绿色为最优)

平台数值
DeepSeek V4.1 Flash261
Gemini 3.1 Pro125
MiniMax M3106
Grok 4.671
GPT-5.6 Sol69
Claude Opus 561
Qwen3.8-Max41
Kimi K337

来源:第三方实测,核对日 2026-09-14;速度为近似值,会随服务端负载波动。

首 Token 延迟(单位:秒(越低越好))#

从发出请求到看见第一个字的时间。该项取「最高推理档位」,即先想再答的思考时间都被计入;交互式场景请务必切到低推理档位,数字会下降一个数量级。

首 Token 延迟对比(对数刻度 · 越短越快 · 绿色为最优)
首 Token 延迟对比(对数刻度 · 越短越快 · 绿色为最优)

平台数值
MiniMax M30.83
DeepSeek V4.1 Flash0.92
Qwen3.8-Max1.80
Kimi K32.99
Gemini 3.1 Pro24.48
Claude Opus 536.03
Grok 4.638.01
GPT-5.6 Sol124.83

来源:第三方实测,核对日 2026-09-14。

月成本曲线(按 4 : 1 的输入 / 输出比例估算)#

月成本曲线(输入占 80%、输出占 20%,双对数刻度;月用量 1000 百万 Token 时 Claude Opus 5 约 9000 美元/月,DeepSeek V4.1 Flash 约 240 美元/月)
月成本曲线(输入占 80%、输出占 20%,双对数刻度;月用量 1000 百万 Token 时 Claude Opus 5 约 9000 美元/月,DeepSeek V4.1 Flash 约 240 美元/月)

用量越大,价差被放大的倍数越惊人:月用量 1000 万 Token 时,Claude Opus 5 约 $90、DeepSeek V4.1 Flash 约 $2.4;月用量涨到 10 亿 Token(规模化挂机跑 Agent 的量级),差距拉大到 $9000 对 $240。而缓存命中折扣会把这条绿线再压低一个数量级——这也是「跑 Agent 该选谁」的关键论据。

展开精确数值表(6 家 × 5 档用量,单位:美元 / 月)

来源:见本页文末「数据来源」说明 · 核对日 2026-09-14

月用量DeepSeek V4.1 FlashGLM-5.3Qwen3.8-MaxGemini 3.1 ProGPT-5.6 SolClaude Opus 5
10 百万$2.4$20.0$28.0$40.0$72.0$90.0
50 百万$12.0$100$140$200$360$450
100 百万$24.0$200$280$400$720$900
500 百万$120$1,000$1,400$2,000$3,600$4,500
1000 百万$240$2,000$2,800$4,000$7,200$9,000

图注:估算口径:输入占 80%、输出占 20%,未计入缓存命中折扣与批量折扣,故实际账单通常低于表中数值。x 轴与 y 轴均为对数刻度,刻度线与数据点使用同一套映射,两端各留出余量以便看清最低与最高两条线。

DeepSeek V4.1 Flash 专项对比#

它是 DeepSeek 的 Flash 系列新作,也是第一个采用因果编解码器(CED)架构的模型:把 40 层 Transformer 拆成 20 层编码器 + 20 层解码器,输入阶段激活 8B 参数、输出阶段激活 16B 参数,配合压缩稀疏注意力与 FP4 KV 缓存,把全局 KV 缓存压到每 Token 约 890 字节——约为上一代 V4-Flash 的四分之一。官方称其在性能、成本、速度与总耗时上全面超越 V4 Pro,并已开始有序下线 V4 Pro。

来源:见本页文末「数据来源」说明 · 核对日 2026-09-14

规格项参数说明
总参数量552B(MoE)预填充阶段激活 8B、解码生成阶段激活 16B;另含约 196B 的稀疏条件记忆模块
架构CED 因果编解码器20 层编码 + 20 层解码;压缩稀疏注意力 2 + 分层稀疏索引 + FP4 KV 缓存
上下文1,048,576 Token约 78.6 万汉字;单次最大输出 384K Token
多模态支持图像输入同时支持思考 / 非思考模式、JSON 输出、工具调用、前缀续写与 FIM 补全
开放程度MIT 许可、权重已开放权重已在 Hugging Face 发布;但 552B 规模远超消费级 Mac 内存,本地跑不动,走 API 才是正确用法
API 模型名deepseek-flash旧名 deepseek-v4-flash 仍可用,请求会被路由到本模型并按 Flash 价格计费
V4 Pro 去向2026-09-14 12<00> 起路由北京时间 9 月 14 日中午起,deepseek-v4-pro 的请求全部转发到 V4.1 Flash,直至未来发布 V4.1 Pro

价格对比:与当前主流旗舰同一口径(每百万 Token,美元)#

来源:见本页文末「数据来源」说明 · 核对日 2026-09-14

模型输入输出缓存命中读取定位
DeepSeek V4.1 Flash$0.15$0.60$0.003超长上下文 + 极低缓存成本,Agent 友好
GPT-5.6 Sol$4$20$0.40通用旗舰,生态最全
Claude Opus 5$5$25$0.50长文本与代码工程旗舰
Kimi K3$3$15$0.30超长文档与图表识别
为什么「缓存命中价」才是关键

跑 Agent 时,系统提示词、工具定义、代码库片段与会话历史会被反复读取。按官方举例:一个 50 万 Token 的可复用前缀被 100 次请求复用,即 5000 万缓存输入 Token——在 V4.1 Flash 上约 $0.15,而同等用量在 Kimi K3 约 $15、GPT-5.6 Sol 约 $20、Claude Opus 5 约 $25。差距接近两个数量级,这也是它适合长时间挂着跑 Agent 的原因。

基准成绩(官方公布)#

来源:基准测试:公开技术报告与第三方榜单 · 核对日 2026-09-14

基准V4.1 Flash对照
GPQA Diamond90.9研究生级科学问答,最高推理档位
Humanity’s Last Exam36.8(纯文本) 63.9(可调用工具)通用难题集,带工具后提升明显
DeepSWE v1.174.2略高于 Claude Opus 5(74.0)与 GPT-5.6 Sol(73.0)
两点务必留意

一、高峰时段价格翻倍。 闲时价(上表)适用于非高峰时段;高峰时段为周一至周五 01<00>–04<00> 与 06<00>–10<00> UTC,对应北京时间 09<00>–12<00> 与 14<00>–18<00>——正好是国内工作时段,所以整段工作的成本要按 2 倍估算,而缓存命中价(高峰 $0.006)仍然是省钱的核心手段。二、新架构存在已知边界。 官方说明稀疏选择误差与近似状态重建可能在极端情况下影响能力,尤其在超长上下文的稀疏检索与缓存续传边界上,仍在补充压力测试。

读表提示

API 费用随用量线性增长,订阅费为固定支出——两者的取舍见本部分第 3 节。表中除 DeepSeek V4.1 Flash 为新近公开资料外,其余价格与档位沿用原文数据;全部条目以 2026-09-14 为准,会随时调整,请以厂商官网为准。

各平台适合谁、擅长什么#

按「谁适合用」与「最擅长什么」两条线,快速定位该选哪家。卡片中的模型名与本部分第 1 节保持同一口径(核对日 2026-09-14)。

按需求找平台#

先说你最常干的事,再落到具体平台。每个需求给出首选与备选,并同时写明「要留意」的部分——没有一家是全能选手。

读长文档 / 写论文#

这一需求下值得先试的平台,按推荐顺序排列:

来源:价格:各平台官网公开价 · 核对日 2026-09-14

平台为什么选它要留意
首选 Kimi K3超长文档阅读与总结,整本书、几十篇论文可一次丢入;PDF 图表与公式识别准。1M 上下文,但输出价 $15 / 百万,长回答成本偏高
备选 Claude Opus 5长文本严谨推理,合同、财报、法律文书分析稳。单价最高,适合项目制而非日常刷量
备选 DeepSeek V4.1 Flash1M 上下文 + 缓存命中价 $0.003,批量读同一批资料时最省。极端长文末端的召回质量仍需自己实测

编程与代码工程#

这一需求下值得先试的平台,按推荐顺序排列:

来源:基准测试:公开技术报告与第三方榜单 · 核对日 2026-09-14

平台为什么选它要留意
首选 Claude Opus 5代码工程能力极强,配合 Claude Code 可端到端交付。Claude Code 是独立产品,需单独装
备选 DeepSeek V4.1 FlashDeepSWE v1.1 得分 74.2,当前公开榜单第一,且单价最低。复杂重构仍建议人工复核
备选 GPT-5.6 Sol生态最全,插件与 Agent 工具链最完善。首 Token 延迟最高(124.83s,最高推理档)

中文写作与日常办公#

这一需求下值得先试的平台,按推荐顺序排列:

来源:价格:各平台官网公开价 · 核对日 2026-09-14

平台为什么选它要留意
首选 豆包 Seed-2.1-Pro中文理解与国内生活场景适配最好,国内访问速度快。上下文 256K,是十家里最小的
备选 Qwen3.8-Max综合均衡、企业级稳定,阿里云生态集成顺。输出价 $6 / 百万,中档偏上
备选 DeepSeek V4.1 Flash中文论文润色、数学推理强,成本极低。高峰时段价格翻倍,注意错峰

多模态(图 / 视频 / 语音)#

这一需求下值得先试的平台,按推荐顺序排列:

来源:见本页文末「数据来源」说明 · 核对日 2026-09-14

平台为什么选它要留意
首选 Gemini 3.1 Pro原生多模态架构,视频理解领先,Workspace 深度集成。发布较早,纯文本推理分数偏低
备选 豆包 Seed-2.1-Pro图片、视频、语音能力全面,国内速度好。部分能力需走火山方舟特定接口
备选 MiniMax M3同价位里语音与视频生成能力突出,单价极低。文本推理不是它的强项

极致省成本#

这一需求下值得先试的平台,按推荐顺序排列:

来源:见本页文末「数据来源」说明 · 核对日 2026-09-14

平台为什么选它要留意
首选 DeepSeek V4.1 Flash输入 $0.15 / 输出 $0.60,缓存命中 $0.003,Agent 场景无人能敌。高峰时段(北京时间 09–12、14–18)翻倍
备选 MiniMax M3输入 $0.30 / 输出 $1.20,是主流旗舰的十分之一量级。未公开缓存命中价
备选 GLM-5.3开源生态完善,可本地部署进一步压掉边际成本。自建要算电费与运维

实时信息与舆情#

这一需求下值得先试的平台,按推荐顺序排列:

来源:见本页文末「数据来源」说明 · 核对日 2026-09-14

平台为什么选它要留意
首选 Grok 4.6实时检索与热点追踪,与 X 平台生态深度联动。上下文 500K,弱于头部
备选 GPT-5.6 Sol综合推理最强兜底,可自行组合联网工具。自带实时性弱于 Grok

私有化 / 本地部署#

这一需求下值得先试的平台,按推荐顺序排列:

来源:见本页文末「数据来源」说明 · 核对日 2026-09-14

平台为什么选它要留意
首选 GLM-5.3开源可微调,支持私有化部署,数据安全可控。需要自己承担运维
备选 Qwen3.8-Max开源模型生态完善,本地与云上可同一套代码。本地小尺寸版本能力会下降

企业级稳定与生态#

这一需求下值得先试的平台,按推荐顺序排列:

来源:见本页文末「数据来源」说明 · 核对日 2026-09-14

平台为什么选它要留意
首选 Qwen3.8-Max企业级 SLA 与阿里云服务深度集成,稳定性优先。创新速度不如海外旗舰
备选 GPT-5.6 Sol插件与 Agent 生态最丰富,工具链最完善。国内直连需自备通道
备选 Claude Opus 5长文本 + 代码工程双强,适合交付型团队。价格最高一档

平台档案#

下面按平台逐一给出完整画像:适合谁、最擅长什么、控制台入口。

🌙 Kimi K3#

月之暗面 · API 控制台

适合: 科研人员、研究生、文献工作者,以及需要批量处理长文档的人。

最擅长:

  • 超长文档阅读与总结,整本书 / 几十篇论文可直接丢入
  • PDF 图表、公式、数据精准识别与提取
  • 文献综述、对比分析、研究方法梳理

🔮 DeepSeek V4.1 Flash#

深度求索 · 2026-09-10 发布 · API 控制台API 文档

适合: 学生、中文写作者、程序员、预算敏感的科研用户,以及需要超长上下文又在意成本的团队。

最擅长:

  • 超长上下文:100 万 Token(约 78.6 万汉字),整本书或整套文档可一次丢入
  • 成本极低:闲时输入 ¥1.08 / 百万 Token,缓存命中读取仅 ¥0.02 / 百万
  • 中文论文润色、数学推理、代码生成,理工科友好,DeepSWE v1.1 得分 74.2
  • 原生支持图像输入与工具调用,适合长时间跑 Agent 流水线

🤖 OpenAI / ChatGPT#

GPT-5.6 Sol · API 控制台

适合: 开发者、重度通用用户、需要插件生态、追求稳定性的人。

最擅长:

  • 通用推理、多模态处理、复杂综合任务兜底
  • 插件与 Agent 生态最丰富,工具链最完善
  • 多语言、跨领域知识覆盖面最广

🧠 Anthropic Claude#

Claude Opus 5 / Claude Code · API 控制台

适合: 程序员、法律与金融从业者、长文本处理专业人士。

最擅长:

  • 超长上下文严谨推理,代码工程能力极强
  • Claude Code 终端自主开发,端到端交付任务
  • 合同、财报、法律文书等专业长文档分析

💎 Google Gemini#

Gemini 3.1 Pro · AI Studio

适合: 谷歌生态用户、有多模态需求者、科研工作者。

最擅长:

  • 原生多模态架构,视频理解领先
  • Google Workspace 深度集成,办公协同顺畅
  • 百万级超长上下文,适合大项目分析

🫘 字节跳动 豆包#

Doubao-Seed-2.1-Pro · 火山方舟控制台

适合: 国内普通用户、内容创作者、中文办公人群。

最擅长:

  • 中文理解与生成,国内生活场景适配最好
  • 多模态生成,图片、视频、语音能力全面
  • 国内访问速度快,稳定不卡顿

🐑 阿里云 通义千问#

Qwen3.8-Max · 百炼控制台

适合: 企业用户、开发者、阿里云生态用户。

最擅长:

  • 综合能力均衡,企业级稳定可靠
  • 开源模型生态完善,可本地部署
  • 阿里云服务深度集成

🌟 智谱 AI GLM#

GLM-5.3 · 开放平台

适合: 开源开发者,以及有本地化部署需求的企业 / 个人。

最擅长:

  • 开源模型生态完善,可本地部署、微调
  • 数学推理能力突出,理工科友好
  • 支持私有化部署,数据安全可控

🚀 Grok(xAI)#

Grok 4.6 · xAI 平台

适合: 需要实时信息、社交舆情与口语化表达的人。

最擅长:

  • 实时信息检索与热点追踪,时效性突出
  • 社交场景与短文本创作,语气自然
  • 与 X 平台生态深度联动

🧩 MiniMax#

MiniMax M3 · 开放平台

适合: 预算极紧、又需要长上下文与多模态输出的个人与小团队。

最擅长:

  • 单价极低,输入价约为主流旗舰的 1/10
  • 中文长文本处理,百万级上下文
  • 语音与视频生成能力在同价位中突出

自己跑一遍再选型:A/B 测评模板#

前面所有维度都是别人测出来的。真正决定选谁,要用你自己的任务跑一遍——同一批输入、同一份 prompt,只换模型。下面是一份能直接改的最小模板。

要记录的字段怎么取为什么值得记
是否通过用规则或人工给每条输出打 0 / 1(能自动校验的用断言,不能的抽样人工看)这是唯一真正重要的指标:通过率决定这套流程能不能上线
首 Token 延迟发起请求到收到第一个字的时间交互式场景的体感上限;批量场景可以忽略
总耗时从发起到收完换算成「每小时能处理多少条」
输入 / 输出 token响应里的 usage 字段乘上单价就是单条成本,能直接对上成本曲线
失败与重试次数记录错误码与重试轮数稳定性差一个数量级,运维成本差一个数量级
人工接管次数统计「你必须动手改才可用」的比例这是隐形成本的大头,也是便宜模型最容易踩的坑
# ab_test.py:同一批任务打 3 家,输出一张可对比的 CSV
import csv, os, time
from providers import build_client # 自己封一层,屏蔽各家 SDK 差异
CASES = [line.strip() for line in open("cases.txt", encoding="utf-8") if line.strip()]
MODELS = ["deepseek-v4.1-flash", "gpt-5.6-sol", "claude-opus-5"]
ROWS = []
for name in MODELS:
client = build_client(name)
for i, case in enumerate(CASES, 1):
t0 = time.time(); first = None; usage = {}
try:
for chunk in client.stream(case):
if first is None:
first = time.time() - t0
usage = chunk.usage or usage
ok = verify(case, chunk.text) # 自动校验,返回 0/1
except Exception as e:
ok, first = 0, None
ROWS.append({"model": name, "case": i, "pass": ok,
"ttft": first, "total": time.time() - t0,
"in": usage.get("in"), "out": usage.get("out")})
with open("result.csv", "w", newline="", encoding="utf-8") as f:
w = csv.DictWriter(f, fieldnames=ROWS[0].keys()); w.writeheader(); w.writerows(ROWS)
# 汇总:通过率 / 平均耗时 / 单条成本
for name in MODELS:
r = [x for x in ROWS if x["model"] == name]
pass_rate = sum(x["pass"] for x in r) / len(r)
print(f"{name}: 通过率 {pass_rate:.0%}"

口径:样本量建议至少 30 条真实任务,且要覆盖你日常的难点(不是挑最简单的例子);低于 20 条时通过率的置信区间会宽到没有区分度。多跑一轮换一批输入的结论,比在同一批上反复调 prompt 更可靠。「最强」「最擅长」「最适合」这类判断都只是在这套测评下的相对结论,不构成对任何平台的绝对评价。

本节口径:一、「按需求找平台」里的首选 / 备选是依据本页 1.2 的八个维度与本页表格中的能力描述综合排序的结果,不是评测结论,同档位平台互换通常也不会出错。二、「平台档案」里的一句话定位 / 最强项 / 最适合 / 要留意是编辑归纳,来源为各平台官方文档与公开评测,核对日 2026-09-14;这类判断带主观成分,请以你自己的任务实测为准(可用 2.3 的 A/B 模板)。

订阅还是 API:分平台选购指南#

判断标准只有两条:用量是否稳定是给自己用还是给程序用

一句话通用规则

选订阅: 每天都用、用量稳定且偏大,主要是手动聊天 / 写代码 / 日常答疑。选 API: 用量波动大、需要批量处理文档数据、跑 Agent 自动化、接入自己的程序。

分平台对照#

判断标准只有两条:用量是否稳定是给自己用还是给程序用。下面按平台逐个对照。

DeepSeek V4.1 Flash#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

每天都用、月用量稳定在 300 万 Token 以上;主要手动聊天、写代码、日常答疑。注意高峰期(北京时间 09<00>–12<00>、14<00>–18<00>)API 价格翻倍,重度白天使用者可考虑订阅

⚡ 适合选 API#

用量波动大、批量处理文档 / 数据、跑 Agent 自动化、接入自己的程序;月用量低于 200 万 Token 时 API 便宜很多,且系统提示词与工具定义被反复读取时缓存命中价仅 ¥0.02 / 百万,跑 Agent 的成本优势最大

ChatGPT(OpenAI)#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

日常高频通用场景,需要插件、GPTs、高级语音视频功能;重度每日使用者

⚡ 适合选 API#

开发应用、自动化工作流、批量处理、需要高并发调用;用量少的时候更划算

Claude(Anthropic)#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

天天读长文档、写代码、用 Claude Code;每月稳定高用量

⚡ 适合选 API#

批量长文档处理、项目制工作流、接入第三方客户端;用量波动大

Google Gemini#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

谷歌全家桶用户、日常多模态需求、需要 Gemini Advanced 完整功能

⚡ 适合选 API#

批量多模态处理、视频理解、谷歌云工作流;用量灵活

Kimi(月之暗面)#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

科研人员每天读论文、重度长文档用户;持续高频使用

⚡ 适合选 API#

阶段性批量处理文献、做文献综述、自动化解析 PDF;不用时零成本

字节豆包#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

国内日常办公、内容创作、经常用专家模式;固定月费省心

⚡ 适合选 API#

批量内容生产、电商客服、自动化运营;接入自己的业务系统

通义千问(阿里云)#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

阿里云用户、企业日常办公、用量稳定

⚡ 适合选 API#

企业级集成、工作流自动化、结合云服务部署;按量计费更灵活

智谱 GLM#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

日常高频使用、数学推理、需要完整模型权限

⚡ 适合选 API#

开发者、本地部署 + 云端混合、定制化业务集成;开源生态适配

Grok(xAI)#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

需要实时信息与社交舆情、且习惯 X 平台生态的重度用户

⚡ 适合选 API#

把实时检索接进自动化流程、做舆情监控与热点选题;用量弹性大

MiniMax#

同一家平台,「订订阅」与「走 API」分别适合什么人:

✅ 适合选订阅#

预算有限、以中文长文本与音视频生成为主的个人用户

⚡ 适合选 API#

大批量低价推理、长文档处理、语音与视频生成流水线

Claude Code 专项说明#

它不是独立 API,而是 Anthropic 官方推出的终端 AI 编程助手,一个基于 Claude API 的客户端 Agent 工具。官网 claude.com/product/claude-code · 文档 docs.claude.com/claude-code

核心能力#

  • 直接读取整个代码库,理解项目架构
  • 自主执行多步开发任务,端到端交付
  • 原生支持终端命令、Git 操作、运行测试
  • 200K 上下文,可覆盖中型完整项目

价格与横向对比#

  • Max 订阅 $20 / 月,含额度,超量部分走 API 计费
  • 也可以绑定自己的 API Key,按量付费
  • 对比 Cursor:更擅长自主任务,定位偏「工程助理」
  • 对比 Codex:纯终端形态,更极客,支持多模型

接下来:模型选完,还有一条完全不同的路线:把模型搬到本机跑。它换来的不是更强的能力,而是「数据不出门」与「零边际成本」——代价是硬件投入与运维时间。

版权与免责声明

本文档仅供个人学习与研究使用, 不得用于商业用途 ,亦不构成任何收益承诺。

支持与分享

如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!

打赏
选模型:10 家平台全维度对比与选购指南
https://firefly.cuteleaf.cn/posts/mac-api-02-models/
作者
AWF
发布于
2026-09-15
许可协议
CC BY-NC-SA 4.0
Profile Image of the Author
AWF
Hello, I'm AWF.
公告
欢迎来到我的博客!这是一则示例公告。
分类
标签
最新动态
站点统计
文章
23
分类
3
标签
50
总字数
84,683
运行时长
0
最后活动
0 天前
站点信息
构建平台
Local
博客版本
Firefly v6.16.8
文章许可
CC BY-NC-SA 4.0
1
选模型:10 家平台,一张图比到底
2
主流 API 全维度对比:10 家平台最新旗舰
十家平台最新旗舰一览
八维度动态对比图
输入价格(单位:$ / 百万 Token)
输出价格(单位:$ / 百万 Token)
缓存命中价(单位:$ / 百万 Token(输入侧))
上下文窗口(单位:千 Token(K))
综合智能指数(单位:分(同口径快照))
编程 Agent 能力(单位:DeepSWE v1.1 得分(%))
输出速度(单位:Token / 秒)
首 Token 延迟(单位:秒(越低越好))
月成本曲线(按 4 : 1 的输入 / 输出比例估算)
DeepSeek V4.1 Flash 专项对比
价格对比:与当前主流旗舰同一口径(每百万 Token,美元)
基准成绩(官方公布)
3
各平台适合谁、擅长什么
按需求找平台
读长文档 / 写论文
编程与代码工程
中文写作与日常办公
多模态(图 / 视频 / 语音)
极致省成本
实时信息与舆情
私有化 / 本地部署
企业级稳定与生态
平台档案
🌙 Kimi K3
🔮 DeepSeek V4.1 Flash
🤖 OpenAI / ChatGPT
🧠 Anthropic Claude
💎 Google Gemini
🫘 字节跳动 豆包
🐑 阿里云 通义千问
🌟 智谱 AI GLM
🚀 Grok(xAI)
🧩 MiniMax
自己跑一遍再选型:A/B 测评模板
4
订阅还是 API:分平台选购指南
分平台对照
DeepSeek V4.1 Flash
✅ 适合选订阅
⚡ 适合选 API
ChatGPT(OpenAI)
✅ 适合选订阅
⚡ 适合选 API
Claude(Anthropic)
✅ 适合选订阅
⚡ 适合选 API
Google Gemini
✅ 适合选订阅
⚡ 适合选 API
Kimi(月之暗面)
✅ 适合选订阅
⚡ 适合选 API
字节豆包
✅ 适合选订阅
⚡ 适合选 API
通义千问(阿里云)
✅ 适合选订阅
⚡ 适合选 API
智谱 GLM
✅ 适合选订阅
⚡ 适合选 API
Grok(xAI)
✅ 适合选订阅
⚡ 适合选 API
MiniMax
✅ 适合选订阅
⚡ 适合选 API
5
Claude Code 专项说明
核心能力
价格与横向对比
文章目录
1
选模型:10 家平台,一张图比到底
2
主流 API 全维度对比:10 家平台最新旗舰
十家平台最新旗舰一览
八维度动态对比图
输入价格(单位:$ / 百万 Token)
输出价格(单位:$ / 百万 Token)
缓存命中价(单位:$ / 百万 Token(输入侧))
上下文窗口(单位:千 Token(K))
综合智能指数(单位:分(同口径快照))
编程 Agent 能力(单位:DeepSWE v1.1 得分(%))
输出速度(单位:Token / 秒)
首 Token 延迟(单位:秒(越低越好))
月成本曲线(按 4 : 1 的输入 / 输出比例估算)
DeepSeek V4.1 Flash 专项对比
价格对比:与当前主流旗舰同一口径(每百万 Token,美元)
基准成绩(官方公布)
3
各平台适合谁、擅长什么
按需求找平台
读长文档 / 写论文
编程与代码工程
中文写作与日常办公
多模态(图 / 视频 / 语音)
极致省成本
实时信息与舆情
私有化 / 本地部署
企业级稳定与生态
平台档案
🌙 Kimi K3
🔮 DeepSeek V4.1 Flash
🤖 OpenAI / ChatGPT
🧠 Anthropic Claude
💎 Google Gemini
🫘 字节跳动 豆包
🐑 阿里云 通义千问
🌟 智谱 AI GLM
🚀 Grok(xAI)
🧩 MiniMax
自己跑一遍再选型:A/B 测评模板
4
订阅还是 API:分平台选购指南
分平台对照
DeepSeek V4.1 Flash
✅ 适合选订阅
⚡ 适合选 API
ChatGPT(OpenAI)
✅ 适合选订阅
⚡ 适合选 API
Claude(Anthropic)
✅ 适合选订阅
⚡ 适合选 API
Google Gemini
✅ 适合选订阅
⚡ 适合选 API
Kimi(月之暗面)
✅ 适合选订阅
⚡ 适合选 API
字节豆包
✅ 适合选订阅
⚡ 适合选 API
通义千问(阿里云)
✅ 适合选订阅
⚡ 适合选 API
智谱 GLM
✅ 适合选订阅
⚡ 适合选 API
Grok(xAI)
✅ 适合选订阅
⚡ 适合选 API
MiniMax
✅ 适合选订阅
⚡ 适合选 API
5
Claude Code 专项说明
核心能力
价格与横向对比