OpenAI 兼容模型的定价变化很快,而且每家算法都不一样——促销窗口、缓存档位、高峰/非高峰时段。这是截至 2026 年 8 月的菜单:6 个拥有 OpenAI 兼容端点的模型,可以直接接入 Glarity 这类浏览器扩展(一个 Key、一个 API 主机、一个路径)。先说结论:Claude Opus 5($5/$25 每百万 token)和 GPT-5.6 Sol($4/$20)是高端层;Gemini 3.7 Flash、GLM-5.3-Flash、DeepSeek V4 Flash 是性价比层;Qwen3.6-Plus($0.50/$3.00)位于中间,带 100 万 token 输入窗口。
六个模型,价格横排对比
价格均为 2026 年 8 月 28 日时点的官方费率(每 100 万 token,即 MTok)。来源:Anthropic、OpenAI、Google、智谱、阿里云、DeepSeek:
模型 | 输入 / 输出(每 MTok) | 上下文 / 最大输出 | 备注 |
|---|---|---|---|
Claude Opus 5 | $5.00 / $25.00 | 1M / 128K | 与 Opus 4.8 同价;思考默认开启 |
GPT-5.6 Sol | $4.00 / $20.00(短上下文)· $8.00 / $30.00(长上下文) | — | 缓存输入 $0.40;促销价至少到 2026-11-21 |
Gemini 3.7 Flash | $0.75 / $3.75(促销) | — | 促销至 2026-12-31,之后 $1.50 / $7.50;缓存 $0.075;有免费档 |
GLM-5.3-Flash | GLM-5.3 的 1/10(促销期 1/20) | 1M / 128K | 智谱官方口径:同等智力约为 Claude Opus 4.8 的 1/40;MIT 开源权重 |
Qwen3.6-Plus | $0.50 / $3.00(输入 ≤256K)· $2.00 / $6.00(256K–1M) | 1M / — | 国际站(Singapore)费率 |
DeepSeek V4 Flash | $0.22 / $0.66(非高峰)· $0.44 / $1.32(高峰) | 1M / 384K | 缓存命中输入低至 $0.007;高峰时段为 UTC 周一至五 01:00–04:00 与 06:00–10:00 |
每月 1 亿 token 要花多少钱?
一个贴近现实的摘要工作负载:1 亿 token 输入(网页、转写、文档)+ 1000 万 token 输出(摘要、回答):
模型 | 1 亿输入 + 1000 万输出 |
|---|---|
Claude Opus 5 | $750 |
GPT-5.6 Sol | $600(短上下文标准价) |
Gemini 3.7 Flash | $112.50(促销;2026-12-31 后为 $225) |
Qwen3.6-Plus | $80(请求 ≤256K 输入;多数超出则为 $260) |
DeepSeek V4 Flash | $28.60(非高峰;高峰 $57.20,缓存命中输入可降到几十美元以下) |
GLM-5.3-Flash | 官方仅公布相对价 — 智谱口径:GLM-5.3 的 1/10,促销 1/20,同等智力约 Opus 4.8 的 1/40 |
输入密集的用法(翻译、反复读同一篇原文)适合"输入便宜或缓存便宜"的模型;输出密集的用法(改写、长摘要)适合输出单价低的模型。
场景选型:什么任务配什么模型
任务 | 选它 | 理由 |
|---|---|---|
长文档研究、严谨核查 | Claude Opus 5 | 100 万上下文、思考默认开;正确性优先时这 $5/$25 花得有值 |
超大文件内容抽取 | GPT-5.6 Sol | 长上下文档强;促销期内短上下文标准价 $4/$20 |
整页 / 整篇文档翻译 | DeepSeek V4 Flash | 非高峰 $0.22 输入,缓存命中 $0.007 — 反复重读同一原文几乎免费 |
日常页面与 YouTube 摘要 | Gemini 3.7 Flash 或 GLM-5.3-Flash | 促销期输入低于 $1;GLM-5.3-Flash 额外有 MIT 开源权重、1/10 价格 |
高频轻量问答、起草 | Qwen3.6-Plus | 输入 ≤256K 时 $0.50 / $3.00 |
常驻转写类负载 | DeepSeek V4 Flash(非高峰) | 输出 $0.66 — 六家官方表中最低的输出单价 |
为什么 OpenAI 兼容对浏览器扩展这么关键
Glarity 的 设置 → 一般 → Connect to AI 只收:OpenAI API Key、模型名、上下文窗口预设、API 主机、API 路径——所以任何提供 OpenAI 风格 /chat/completions 端点的厂商都能接。上面 6 家全部支持:Anthropic 公开了 OpenAI SDK 兼容层,https://api.anthropic.com/v1/ 即可接入(官方说明用于测试与对比,而扩展的模型切换正是这个场景);Google Gemini API 提供 OpenAI 兼容模式;智谱为 GLM 系列提供 OpenAI 兼容基址;阿里云 Model Studio 与 DeepSeek 天生 OpenAI 兼容;OpenAI 本身就是。
切换模型时,Glarity 里的任务(摘要、翻译、问答)不动,变的只有主机、Key 和每 token 单价。逐步设置见 在 Glarity 使用 Qwen3.6-Plus 与 在 Glarity 使用 GLM-5.3-Flash。
FAQ
6 个里哪个最便宜?取决于流量形态。输入密集的活,DeepSeek V4 Flash 是官方最低(非高峰 $0.22,缓存命中 $0.007)。日常混合摘要,则是 Gemini 3.7 Flash 促销价($0.75/$3.75)和 Qwen3.6-Plus($0.50/$3.00,输入 ≤256K)最划算,且不受时段限制。
价格会变吗?会,好几个是促销价。GPT-5.6 Sol 促销至少到 2026-11-21;Gemini 3.7 Flash 2027-01-01 起翻倍;DeepSeek V4 Flash 非高峰更便宜。下单前先查各家官方定价页。
哪个是开源的? GLM-5.3-Flash。智谱按 MIT 许可公开权重,也可以不经过 API 自托管。其余各家按官方页面仅提供 API。
这些模型能用在 Glarity 里吗?可以。把 设置 → 一般 → Connect to AI 选成 OpenAI API key,粘贴对应厂商的 Key,选 Custom Model 填模型代码,上下文窗口预设设为该模型输入上限,API 主机与路径照兼容文档填写。先 Test 再 Save。
该盯输入价还是输出价?都盯,但看任务形态:YouTube 摘要读长篇转写、写短摘要——输入主导;整篇翻译/改写会产生大量输出 token——输出单价主导。
Glarity 编辑部专注 AI 搜索、视频总结与浏览器提效技巧。
Glarity 是支持 AI 搜索与 YouTube 总结的免费浏览器扩展,可在 glarity.app 获取。



