文档

视频生成任务

更新于 2026-08-30

接口概览

视频生成是异步操作:

  1. 调用 POST /v1/videos/tasks 提交任务
  2. 保存响应中的公开任务 ID
  3. 调用 GET /v1/tasks/{task_id} 查询状态和结果

Base URL 为 https://api.rokoapi.com/v1。所有请求都要携带 Authorization: Bearer $API_KEY

提交响应在兼容期同时返回 idtask_id,两者值相同。新代码应读取 task_id;原来读取 id 的代码无需修改。生产环境应为每次业务操作设置唯一的 Idempotency-Key。相同 Key 和相同请求重试时会重放第一次响应,不会创建第二个上游任务;完整规则见图像生成任务的幂等提交说明,该规则同样适用于图片、视频和音频统一任务端点。

已适配模型

系列对外模型 ID
Seedance 2.0seedance-2.0seedance-2.0-proseedance-2.0-fastseedance-2.0-mini
Hailuo 3hailuo-3
Grok 1.5 Fast(TTAPI 非官转)grok-imagine-video-1.5
Gemini Omnigemini-omni
Klingkling-3.0-turbokling-o3
Happy Horse 1.1happy-horse-1.1
Midjourney Videomidjourney-video
Wan 3.0wan3.0-video
Wan 2.7wan-2.7
Sora 2sora-2sora-2-pro

实际可用范围以 /v1/models、控制台渠道配置和密钥所属分组为准。用户只选择产品模型;RokoAPI 根据 generation_type、素材字段和渠道能力自动选择文生、图生、参考生或编辑路由。供应商内部模型名不会出现在用户响应、计费模型或使用日志中。

TTAPI 渠道目前按能力处理模式,而不是假定所有模型都支持所有生成方式:

对外模型 ID文生首帧图生参考生视频延长generate_audio
grok-imagine-video-1.5支持支持支持 1~7 张参考图不支持声音参考
happy-horse-1.1支持支持支持 1~9 张参考图不支持
midjourney-video支持首帧/首尾帧支持不支持
wan3.0-video支持支持首帧/首尾帧支持图片、视频和音频参考支持

请求显式指定上游不支持的模式或声音开关时,接口返回 400,不会静默忽略参数后提交计费任务。未传 generation_type 时,0 个素材推断为文生、1 张图片推断为图生,多个图片或视频/音频素材推断为参考生。

文生视频

curl https://api.rokoapi.com/v1/videos/tasks \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: YOUR_UNIQUE_REQUEST_ID" \
  -d '{
    "model": "seedance-2.0",
    "generation_type": "text",
    "prompt": "A cinematic sunrise over snow mountains",
    "duration": 8,
    "quality": "720p",
    "aspect_ratio": "16:9",
    "generate_audio": true
  }'

图生与参考生视频

通常通过 image_urlsvideo_urlsaudio_urls 传入可由公网直接下载的素材:

{
  "model": "seedance-2.0",
  "generation_type": "reference",
  "prompt": "Keep the character identity and create a slow camera orbit",
  "image_urls": ["https://example.com/character.png"],
  "video_urls": ["https://example.com/motion.mp4"],
  "duration": 6,
  "quality": "720p",
  "aspect_ratio": "16:9"
}

例外:Wan 2.7 与 TTAPI Wan 3.0 图生视频使用 image_start 和可选的 image_end;Grok 1.5 根据 image_urls 数量自动选择模式(0 张为文生、1 张为图生、2~7 张为参考生)。

视频编辑

{
  "model": "wan-2.7",
  "generation_type": "edit",
  "prompt": "Change the background to a rainy neon street",
  "video_urls": ["https://example.com/input.mp4"],
  "image_urls": ["https://example.com/style.png"],
  "duration": 0,
  "quality": "720p"
}

Wan 2.7 编辑中的 duration: 0 表示跟随输入视频。Gemini Omni 编辑跟随输入视频,不要发送 durationaspect_ratio

Midjourney 视频延长

Midjourney Video 每次生成或延长固定增加 5 秒。延长时传入已完成的上游任务 ID,并从父任务返回的四个视频中选择 0~3 的索引:

{
  "model": "midjourney-video",
  "generation_type": "extend",
  "input_reference": "PARENT_JOB_ID",
  "metadata": {
    "index": 0,
    "animate_mode": "auto",
    "manual": "low",
    "bs": 4,
    "resolution": "sd"
  }
}

延长接口会继承父任务分辨率;metadata.resolution 仅用于预估费用,可填写父任务实际的 sdhd。省略时会按 HD 预留,任务完成后再按 TTAPI 返回的实际 quota 结算。

生成数量可使用统一参数 n,允许值为 124,默认 4;也兼容 TTAPI 原生的 metadata.bs。两者同时提供时必须一致。

参数边界

系列时长画质主要素材限制
Seedance 2.0 / Mini4~15 秒标准版 480p~4k;Fast/Mini 档位较少图生 1~2 张;参考生最多 9 图、3 视频、3 音频
MiniMax H34~15 秒768p、2k参考生最多 9 图、3 视频、3 音频
Grok 1.5 Fast(非官转)6、8~10、12~30 秒480p、720p最多 7 张图片;支持 2:3、3:2、1:1、9:16、16:9
Gemini Omni3~10 秒或 auto固定 720p图生/参考生使用图片;编辑使用一个视频
Kling 3.0 Turbo / O33~15 秒720p、1080p;O3 部分路由支持 4kO3 支持 model_params 自定义多镜头,部分路由支持图片或视频参考
HappyHorse 1.13~15 秒720p、1080p参考生 1~9 张图片
Midjourney Video每次生成/延长固定 5 秒sd、hd生成需 1 张首帧,可选尾帧;延长需父任务 ID 与 0~3 索引
Wan 2.7文生/图生 2~15 秒;参考/编辑 2~10 秒720p、1080p图生首尾帧;参考/编辑支持视频、图片和音频字段
Sora 24、8 或 12 秒由模型档位决定最多 1 张图片;不发送 quality

请求中的额外模型参数会按供应商协议转换,包括 negative_promptgenerate_audiocontent_filtersoundprompt_extendmodel_params。RokoAPI 会先校验时长、画质、画幅、素材数量、声音能力和回调地址等已知边界。除 Midjourney Video 用 n 选择 1、2、4 个输出外,其余视频模型不支持 n

回调与查询

可选的 callback_url 必须是公开 HTTPS 地址,最长 2048 个字符,不能指向 localhost 或内网 IP。即使配置了回调,也建议保留轮询作为容错:

curl https://api.rokoapi.com/v1/tasks/task_public_id \
  -H "Authorization: Bearer $API_KEY"

查询响应中的 state 固定为 queuedin_progresscompletedfailedunknown,推荐新代码使用;旧的 status 字段继续保留。结果链接可能有有效期,生产环境应及时下载并转存。

计费说明

模型采用统一 v2 美元表达式计费,可在一个公式中组合输出秒数、输入参考视频秒数、输入图片数量、音频开关、分辨率、画质、生成方式和 Token 用量。提交时按经过校验的参数预扣;任务完成后根据实际 Token 或输出时长结算。

前端或第三方项目不应直接解析、执行 billing_expr。请从 GET /api/catalog/models 读取目标模型的 pricing_display,按 dimensions 展示参数档位、按 rates 展示每秒价格,并使用 formula 说明总价计算方式。pricing_display.expr_hash 变化表示后台价格规则已经更新,客户端应立即丢弃旧缓存。完整字段和降级规则见模型与定价

以下为固定售价快照,已经包含对应上游公示成本价的 10% 服务费,单位均为美元。价格不会随上游积分实时变化;管理员审核上游调价后再更新本表和后台表达式。

Seedance 2.0 系列

模型档位模式480p720p1080p4K计费单位
Standard / Pro文生、图生、图片或音频参考$0.1012$0.2189$0.5456$1.1132输出秒
Standard / Pro视频参考$0.0616$0.1331$0.3322$0.6875输入与输出秒
Fast(活动价)文生、图生、图片或音频参考$0.0616$0.1331输出秒
Fast(活动价)视频参考$0.0495$0.1067输入与输出秒
Mini(活动价)文生、图生、图片或音频参考$0.0202$0.0436输出秒
Mini(活动价)视频参考$0.0123$0.0264输入与输出秒

Fast 与 Mini 的活动价来自 EvoLink 2026-08-07 调价,活动结束后不会自动改变 RokoAPI 售价,届时以后台审核后的新快照为准。

Grok 1.5 Fast(TTAPI 非官转)

grok-imagine-video-1.5 对外名称当前路由到 TTAPI 非官转的 grok-imagine-video-1.5-fast,按任务时长分档,不使用截图中官转渠道的按秒价格:

视频时长TTAPI 成本RokoAPI 售价(含 10%)
6~10 秒$0.09$0.0990
12~20 秒$0.20$0.2200
21~30 秒$0.30$0.3300

7 秒和 11 秒不受上游支持;480p、720p 同价,最终以 TTAPI 任务结果返回的实际 quota 结算。

其他按秒视频模型

模型低档分辨率售价/秒高档分辨率售价/秒额外费用
hailuo-3768p$0.08362K$0.1353第 6 张起每张输入图 $0.0418
kling-3.0-turbo720p$0.11661080p$0.1463
happy-horse-1.1720p$0.13641080p$0.1826
wan-2.7720p$0.09571080p$0.1595

Kling O3 同时按分辨率和声音开关计费:

分辨率关闭声音开启声音
720p$0.0880/秒$0.1166/秒
1080p$0.1166/秒$0.1463/秒
4K$0.4378/秒$0.4378/秒

Sora 2 系列

模型分辨率4 秒8 秒12 秒
sora-2固定档位$0.3729$0.7458$1.1187
sora-2-pro720p$1.1187$2.2363$3.3550
sora-2-pro1080p$1.8645$3.7279$5.5924

Gemini Omni Token 价格

用量类型固定售价
文本、图片、音频或视频输入$1.43 / 1M tokens
视频输出$16.50 / 1M tokens
思考与其他文本输出$8.47 / 1M tokens

参考视频时长只有在系统完成媒体元数据校验或取得可信用量后才参与最终结算。完整价格以定价页和后台当前配置为准。上游价格来源可参阅 EvoLink 模型目录及各模型开发页面。