智谱 AI · 原生多模态高效模型● 可用

GLM-5.3 Flash API 多模态调用指南

GLM-5.3-Flash 是智谱 GLM-5 系列首个原生多模态模型,面向视觉编程、文档与视频理解及高吞吐 Agent 步骤。Roko API 当前使用 glm-5.3-flash 模型 ID,通过 OpenAI 兼容端点调用。

OpenAI 兼容 按 Token 计费 document 输入image 输入text 输入video 输入 Chat流式输出推理
PRICING

GLM-5.3-Flash API 价格

价格直接读取 Roko API 当前模型快照;实时刷新结果优先于构建快照。

GLM-5.3-Flash

GLM-5.3-Flash

glm-5.3-flash
输入 Token$0.1140 / 1M tokens当前目录价格 · 按实际 Token 计费
输出 Token$0.4000 / 1M tokens当前目录价格 · 按实际 Token 计费
价格快照 正在刷新价格…
OVERVIEW

GLM-5.3 Flash 是什么模型?

智谱官方将 GLM-5.3-Flash 定位为 GLM-5 系列首个原生多模态模型,输入可覆盖视频、图像、文本和文件,输出为文本。模型重点面向视觉 Coding、Office 文档、专业研究及需要视觉反馈闭环的 Agent 工作流。

官方模型页公布了 1M 上下文和 128K 最大输出,并说明思考模式始终开启,同时支持流式输出、Function Calling、上下文缓存、结构化输出与视觉理解。这些是上游模型规格;Roko API 当前页面只把目录中已经配置的模态、推理和流式字段列为接入能力。

Flash 的生产价值来自“先处理大量常规步骤,再把未通过验收的困难任务升级到旗舰模型”。对于图片、视频和文件输入,媒体内容会计入输入 Token;大批量上线前应使用代表性样本读取实际 usage,而不是假设固定换算量。

USE CASES

GLM-5.3 Flash 适合哪些场景?

以下场景基于智谱官方多模态定位;媒体输入是否可用,以本页当前接入信息为准。

01

视觉驱动的编程任务

适合结合界面截图、渲染结果或操作录屏分析前端、游戏和图形应用,并根据视觉反馈迭代。

02

截图与专业文档理解

适合从截图、扫描件、图表和办公文件中提取信息、检查版式并生成结构化结果。

03

视频与文件分析

适合在一次请求中结合文本、视频和文件材料,完成内容理解、归纳和任务分流。

04

大批量 Agent 常规步骤

适合分类、信息抽取、工具结果总结和格式整理,再把少量困难任务升级到旗舰模型。

PARAMETERS

GLM-5.3-Flash API 常用参数

仅列出当前 Roko API 接入已经明确支持或公开配置的字段。

参数类型要求说明
modelstring必填固定填写 glm-5.3-flash。
messagesarray必填按顺序传入对话消息;至少包含一条用户消息。
streamboolean可选设为 true 时使用 SSE 流式返回。
reasoning_effortstring可选控制推理强度;可用值以当前上游接口响应为准。
messages[].content[]array可选多模态消息内容块;媒体字段格式以当前 Chat Completions 文档为准。
thinkingobject可选当前模型配置要求启用推理;不要发送关闭思考的设置。
QUICKSTART

GLM-5.3-Flash API 调用示例

使用 OpenAI 兼容的 Chat Completions 请求即可接入。 API Key 应保存在服务端环境变量中。

Base URLhttps://api.rokoapi.com/v1
curl https://api.rokoapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [
      {"role": "user", "content": "分析这张产品界面截图,识别信息层级和交互问题,并输出结构化改进清单"}
    ],
    "stream": true
  }'
PRODUCTION

计费与上线建议

  1. 1

    当前输入和输出价格读取 Roko API 模型目录;不要使用供应商页面价格替代本页实际计费配置。

  2. 2

    图片、视频和文件内容会计入输入 Token,大批量任务应先使用代表性样本读取实际 usage。

  3. 3

    当前配置标记为必须推理时,不应发送关闭思考的参数;具体可用值以接口响应为准。

  4. 4

    建议记录 Flash 首次通过率和升级到 GLM-5.3 的比例,用每个通过任务的成本评估路由。

FAQ

GLM-5.3-Flash API 常见问题

GLM-5.3-Flash API 使用哪个模型 ID?

使用 glm-5.3-flash。模型 ID 区分字符,请直接复制本页显示的值。

GLM-5.3-Flash API 怎么计费?

Roko API 当前按 Token 计费:输入 $0.1140 / 1M tokens,输出 $0.4000 / 1M tokens。最终费用以实际 usage 和当前价格配置为准。

GLM-5.3-Flash API 使用哪个接口?

当前通过 OpenAI 兼容的 POST /v1/chat/completions 调用,Base URL 为 https://api.rokoapi.com/v1。

GLM-5.3 Flash 支持哪些官方输入类型?

智谱官方列出视频、图像、文本和文件输入,输出为文本。Roko API 的实际可用模态以本页“当前接入信息”和接口验证结果为准。

GLM-5.3 Flash 可以关闭思考吗?

官方文档说明 thinking.type 仅支持 enabled。当前 Roko API 配置也会在推理字段存在时展示对应参数,不应把它当作无推理模型使用。

GLM-5.3 Flash 和 GLM-5.3 如何分工?

Flash 更适合原生多模态、高吞吐和常规 Agent 步骤;GLM-5.3 面向更高难度的纯文本推理与长链路工程任务。建议采用 Flash 优先、未通过验收再升级的路由。

RELATED

比较同系列或其他文本模型的价格与当前接入能力。

浏览全部文本模型 →