2026 年 AI 模型价格一览:6 个 OpenAI 兼容模型对比

Claude Opus 5、GPT-5.6 Sol、Gemini 3.7 Flash、GLM-5.3-Flash、Qwen3.6-Plus、DeepSeek V4 Flash 官方定价横向对比 + 场景选型 + 每月 1 亿 token 预算测算。

OpenAI 兼容模型的定价变化很快,而且每家算法都不一样——促销窗口、缓存档位、高峰/非高峰时段。这是截至 2026 年 8 月的菜单:6 个拥有 OpenAI 兼容端点的模型,可以直接接入 Glarity 这类浏览器扩展(一个 Key、一个 API 主机、一个路径)。先说结论:Claude Opus 5($5/$25 每百万 token)和 GPT-5.6 Sol($4/$20)是高端层;Gemini 3.7 Flash、GLM-5.3-Flash、DeepSeek V4 Flash 是性价比层;Qwen3.6-Plus($0.50/$3.00)位于中间,带 100 万 token 输入窗口。

六个模型,价格横排对比

价格均为 2026 年 8 月 28 日时点的官方费率(每 100 万 token,即 MTok)。来源:AnthropicOpenAIGoogle智谱阿里云DeepSeek:

模型

输入 / 输出(每 MTok)

上下文 / 最大输出

备注

Claude Opus 5

$5.00 / $25.00

1M / 128K

与 Opus 4.8 同价;思考默认开启

GPT-5.6 Sol

$4.00 / $20.00(短上下文)· $8.00 / $30.00(长上下文)

缓存输入 $0.40;促销价至少到 2026-11-21

Gemini 3.7 Flash

$0.75 / $3.75(促销)

促销至 2026-12-31,之后 $1.50 / $7.50;缓存 $0.075;有免费档

GLM-5.3-Flash

GLM-5.3 的 1/10(促销期 1/20)

1M / 128K

智谱官方口径:同等智力约为 Claude Opus 4.8 的 1/40;MIT 开源权重

Qwen3.6-Plus

$0.50 / $3.00(输入 ≤256K)· $2.00 / $6.00(256K–1M)

1M / —

国际站(Singapore)费率

DeepSeek V4 Flash

$0.22 / $0.66(非高峰)· $0.44 / $1.32(高峰)

1M / 384K

缓存命中输入低至 $0.007;高峰时段为 UTC 周一至五 01:00–04:00 与 06:00–10:00

每月 1 亿 token 要花多少钱?

一个贴近现实的摘要工作负载:1 亿 token 输入(网页、转写、文档)+ 1000 万 token 输出(摘要、回答):

模型

1 亿输入 + 1000 万输出

Claude Opus 5

$750

GPT-5.6 Sol

$600(短上下文标准价)

Gemini 3.7 Flash

$112.50(促销;2026-12-31 后为 $225)

Qwen3.6-Plus

$80(请求 ≤256K 输入;多数超出则为 $260)

DeepSeek V4 Flash

$28.60(非高峰;高峰 $57.20,缓存命中输入可降到几十美元以下)

GLM-5.3-Flash

官方仅公布相对价 — 智谱口径:GLM-5.3 的 1/10,促销 1/20,同等智力约 Opus 4.8 的 1/40

输入密集的用法(翻译、反复读同一篇原文)适合"输入便宜或缓存便宜"的模型;输出密集的用法(改写、长摘要)适合输出单价低的模型。

场景选型:什么任务配什么模型

任务

选它

理由

长文档研究、严谨核查

Claude Opus 5

100 万上下文、思考默认开;正确性优先时这 $5/$25 花得有值

超大文件内容抽取

GPT-5.6 Sol

长上下文档强;促销期内短上下文标准价 $4/$20

整页 / 整篇文档翻译

DeepSeek V4 Flash

非高峰 $0.22 输入,缓存命中 $0.007 — 反复重读同一原文几乎免费

日常页面与 YouTube 摘要

Gemini 3.7 Flash 或 GLM-5.3-Flash

促销期输入低于 $1;GLM-5.3-Flash 额外有 MIT 开源权重、1/10 价格

高频轻量问答、起草

Qwen3.6-Plus

输入 ≤256K 时 $0.50 / $3.00

常驻转写类负载

DeepSeek V4 Flash(非高峰)

输出 $0.66 — 六家官方表中最低的输出单价

为什么 OpenAI 兼容对浏览器扩展这么关键

Glarity 的 设置 → 一般 → Connect to AI 只收:OpenAI API Key、模型名、上下文窗口预设、API 主机、API 路径——所以任何提供 OpenAI 风格 /chat/completions 端点的厂商都能接。上面 6 家全部支持:Anthropic 公开了 OpenAI SDK 兼容层,https://api.anthropic.com/v1/ 即可接入(官方说明用于测试与对比,而扩展的模型切换正是这个场景);Google Gemini API 提供 OpenAI 兼容模式;智谱为 GLM 系列提供 OpenAI 兼容基址;阿里云 Model Studio 与 DeepSeek 天生 OpenAI 兼容;OpenAI 本身就是。

切换模型时,Glarity 里的任务(摘要、翻译、问答)不动,变的只有主机、Key 和每 token 单价。逐步设置见 在 Glarity 使用 Qwen3.6-Plus在 Glarity 使用 GLM-5.3-Flash

FAQ

6 个里哪个最便宜?取决于流量形态。输入密集的活,DeepSeek V4 Flash 是官方最低(非高峰 $0.22,缓存命中 $0.007)。日常混合摘要,则是 Gemini 3.7 Flash 促销价($0.75/$3.75)和 Qwen3.6-Plus($0.50/$3.00,输入 ≤256K)最划算,且不受时段限制。

价格会变吗?会,好几个是促销价。GPT-5.6 Sol 促销至少到 2026-11-21;Gemini 3.7 Flash 2027-01-01 起翻倍;DeepSeek V4 Flash 非高峰更便宜。下单前先查各家官方定价页。

哪个是开源的? GLM-5.3-Flash。智谱按 MIT 许可公开权重,也可以不经过 API 自托管。其余各家按官方页面仅提供 API。

这些模型能用在 Glarity 里吗?可以。把 设置 → 一般 → Connect to AI 选成 OpenAI API key,粘贴对应厂商的 Key,选 Custom Model 填模型代码,上下文窗口预设设为该模型输入上限,API 主机与路径照兼容文档填写。先 TestSave

该盯输入价还是输出价?都盯,但看任务形态:YouTube 摘要读长篇转写、写短摘要——输入主导;整篇翻译/改写会产生大量输出 token——输出单价主导。

Glarity 编辑部专注 AI 搜索、视频总结与浏览器提效技巧。

Glarity 是支持 AI 搜索与 YouTube 总结的免费浏览器扩展,可在 glarity.app 获取。