GLM-5.3-Flash 是智谱 AI GLM-5 系列首个原生多模态模型,和 Glarity 是天然的搭档:智谱 BigModel 平台提供的 OpenAI 兼容端点、1M token 上下文窗口、128K 输出上限,官方闪存价仅为 GLM-5.3 的 1/10(上线促销期 1/20)。接入 Glarity 只要五分钟:打开设置 → 常规,选 OpenAI API key,粘贴 BigModel 密钥,填好模型名、上下文窗口、主机与路径,保存即可。
为什么选智谱 GLM-5.3-Flash
GLM 是智谱 AI 的旗舰模型家族,以中文为轴心的多语种工作表现出色,而本次发布起已完全开源(MIT 许可)——权重挂在 Hugging Face 上,不是只能租用的模型。GLM-5.3-Flash 是该家族的闪存价档次:总参数 320B,激活 18B;采用混合稀疏注意力 + 线性注意力架构,并引入 Manifold-Constrained Hyper-Connections(mHC)。据智谱,相比 GLM-5.3,注意力计算量降至 1/3.01、KV 缓存降至 1/4.44——同样的智能,更低的成本。它经 SGLang 跑在国产加速芯片上(encode–prefill–decode 分离架构),是一个不依赖单一 GPU 厂商的开源前沿模型。它支持文本、图像、视频与文件输入,招牌是"始终思考":推理可以加强,但无法关闭。
开始前需要的准备
- 在 BigModel 开放平台创建的智谱 AI API 密钥。
- 本文连接值。
Glarity 配置步骤
进入设置 → 常规,滚动到 Connect to AI for quick Glarity summaries and translations。
- 选择 "OpenAI API key"。
- 把 BigModel 密钥粘贴到 API Key 输入框。
- 模型 —— 选 Custom Model,输入
glm-5.3-flash。 - 模型上下文窗口 —— 选最接近 1,000,000 tokens(官方输入上限;输出 128K)的预设。整本书、一小时长的转录都能装下。
- API 主机 ——
https://open.bigmodel.cn/api/paas/v4(智谱官方 OpenAI 兼容基地址;官方文档明确接口与 OpenAI SDK 兼容,只需替换密钥与基地址)。 - API 路径 ——
/chat/completions。 - 温度 —— 1,智谱推荐默认值(搭配
top_p 0.95);要更严格可复现的翻译可降到 0.5。 - Test,然后 Save。
设置一览
字段 | 值 | 含义 |
|---|---|---|
连接方式 | OpenAI API key | 经 BigModel 兼容模式 |
模型 | Custom Model — | GLM-5 系列首个原生多模态 |
模型上下文窗口 | 1,000,000 tokens(就近选预设) | 官方输入上限;输出 128K |
API 主机 |
| 官方 OpenAI 兼容基地址 |
API 路径 |
| Chat Completions 路由 |
温度 | 1(严格翻译用 0.5) | 智谱推荐设置 |
价格:同样的智能,闪存价
按智谱官方模型文档:GLM-5.3-Flash 定价为 GLM-5.3 的 1/10,上线限时促销再减半(1/20)——官方页面把它表述为"同样智力,约 1/40 Claude Opus 4.8 的价格"。同一页面引用的人工分析智能指数为 57,与 Claude Opus 4.8 持平——而且是在闪存价上持平。若使用 GLM Coding Plan,该模型的额度是 GLM-5.3 的 3 倍,谷时段(含周末)仅消耗 50% 标准积分。以官方页当前数字为准。
GLM-5.3-Flash 版 Glarity 能做什么
功能 | 表现 |
|---|---|
翻译 | 全页沉浸式翻译和左右对照字幕——参见双语字幕教程 |
网页总结 | 以中文为轴的自然多语言总结 |
YouTube 总结 | 基于转录的时间戳要点与 FAQ |
视频字幕 | 字幕生成与翻译 |
快捷邮件回复 | 各语言合适的语域草稿 |
一键提示词 | 保存的任务在自己模型上重跑 |
排障
- Test 返回 401 —— 密钥与主机需同平台:改用 open.bigmodel.cn 创建的密钥,并确认基地址精确为
https://open.bigmodel.cn/api/paas/v4。 - "Model not found" —— 精确输入
glm-5.3-flash;这是模型代码,不是显示名。 - 回答总是带推理 —— GLM-5.3-Flash 的思考无法关闭,这是设计而非缺陷;想要快速随口总结可换轻量模型。
- 长输入被拒 —— 保持在 1M token 输入上限内,并注意输出上限 128K。
- 保存后没变化 —— 确认先 Test 再 Save。
FAQ
GLM-5.3-Flash 开源吗?开源。智谱以 MIT 许可发布权重,官方仓库在 Hugging Face(zai-org/GLM-5.3-Flash)。走 BigModel API 使用则是零部署的方式。
为什么特别擅长多语言? GLM-5.3-Flash 以中文实力为底座、保留完整多语言能力,常开的思考让术语与长文跨语言保持准确。
支持图片和视频吗? API 支持文本之外的图片、视频与文件输入,图片以同款 chat-completions 格式的 image_url 块传入——截图和文档可以跟问题一起带上。
必须用中国平台吗? open.bigmodel.cn 上的 BigModel API 是智谱官方端点;该模型在第三方托管商也有提供,开放权重还可自托管。
长文更贵吗?不贵。GLM-5.3-Flash 在 0–1M 输入 token 内是单一闪存价,这正是 Flash 档的意义。
Glarity 编辑部专注 AI 搜索、视频总结与浏览器提效技巧。
Glarity 是一款免费浏览器扩展,支持 AI 搜索与 YouTube 视频总结,可在 glarity.app 获取。



