Seedance 2.5


Seedance 2.5 是一款基于参考图像、视频和音频进行多模态视频生成的工具,并支持视频编辑与扩展功能。

bytedance/seedance-2-5

Seedance 2.5 支持文本、图像、视频与音频的多模态输入,可用于文生视频、图生视频、参考内容生成及视频编辑等场景。调用方式为异步任务:提交请求获取 task_id,轮询状态后在成功时拉取结果。

1. 认证

API 使用 API Key 进行认证。在请求头中携带 Authorization: Bearer ${ICREAT_API_KEY}

https://icreat.ai/hub/keys 获取你的 API Key。

2. 提交任务

POST /v1/task/submit/bytedance/seedance-2-5 · https://api.icreat.ai/v1/task/submit/bytedance/seedance-2-5

Body Parameters

content

content object[] — 必填。多模态内容数组,支持文本、图像、视频和音频引用的任意组合。详见下方 Schemacontent[] 项说明。

可选字段

  • generate_audio boolean — 是否生成音频。
  • ratio string — 输出宽高比。支持 16:94:31:13:49:1621:9adaptive;设为 adaptive 时模型自动选择最合适宽高比。
  • resolution string — 输出分辨率。支持 480p720p
  • duration integer — 视频时长(秒)。接受 430 的整数,或 -1 让模型自动选择。
  • watermark boolean — 是否添加「AI Generated」水印。
  • tools object[] — 工具列表,目前仅支持 web_search

Returns

返回包含 task_id 的对象。使用该 ID 轮询任务状态并获取生成结果。

3. 轮询状态

POST /v1/task/query-status · https://api.icreat.ai/v1/task/query-status

curl --connect-timeout 10 --max-time 60 \
  -X POST "https://api.icreat.ai/v1/task/query-status" \
  -H "Authorization: Bearer ${ICREAT_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
  "task_id": "task-xxx"
}'

服务器返回任务状态。当状态为 SUCCEEDED 时,可调用获取结果接口。

4. 获取结果

POST /v1/task/get-result · https://api.icreat.ai/v1/task/get-result

curl --connect-timeout 10 --max-time 60 \
  -X POST "https://api.icreat.ai/v1/task/get-result" \
  -H "Authorization: Bearer ${ICREAT_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
  "task_id": "task-xxx"
}'

服务器返回该任务的输出(生成的视频等)。

5. Schema

顶层

API 使用多模态输入结构。content 是必填数组,支持文本、图像、视频和音频引用的任意组合。

字段 类型 必填 描述
content object[] 多模态内容数组。请参见下方 schema
generate_audio boolean 是否生成音频
ratio string 输出宽高比。支持的值:16:94:31:13:49:1621:9adaptive。设置为 adaptive 时,模型会根据输入自动选择最合适的宽高比
resolution string 输出分辨率。支持的值:480p720p
duration integer 视频时长,单位为秒。接受 430 的整数,或使用 -1 让模型自动选择时长
watermark boolean 是否添加「AI Generated」水印
tools object[] 要使用的工具列表

content[]

字段 类型 必填 描述
type string 内容类型:textimage_urlvideo_urlaudio_url
text string 条件必填 type=text 时必填。支持中文、英文、日文、印尼文、西班牙文和葡萄牙文
image_url object 条件必填 type=image_url 时必填。格式:{"url":"https://..."}
video_url object 条件必填 type=video_url 时必填。格式:{"url":"https://..."}
audio_url object 条件必填 type=audio_url 时必填。格式:{"url":"https://..."}
role string 媒体必填 媒体角色:reference_imagereference_videoreference_audiofirst_framelast_frame
need_review boolean 是否将参考内容提交官方审核。当参考内容包含人脸或受版权保护的 IP 时,请将其设置为 true

中文提示词不得超过 2000 个字符,英文提示词不得超过 2000 个单词。过长的提示词可能会稀释信息,导致模型忽略某些细节。

need_review 指南

  • 如果参考内容包含人脸或受版权保护的 IP,请将 need_review 设置为 true;否则生成很可能失败。
  • 如果需要审核的内容在提交时将 need_review 设置为 false,任务很可能失败。
  • 如果不需要审核的内容在提交时将 need_review 设置为 true,生成可能需要更长时间。

参考图像

  • 支持的格式:jpegpngwebpbmptiffgifheicheif
  • 宽高比(宽/高):0.42.5
  • 宽度和高度:3006000 px
  • 每张图像最大大小:小于 30 MB
  • 最大请求体大小:64 MB

支持以下模式:

  1. 首帧模式 — 提供一个 image_url 项,并将其 role 设置为 first_frame
  2. 首尾帧模式 — 提供两个 image_url 项,分别将 role 设置为 first_framelast_frame
  3. 参考图像模式 — 提供 1–30 个 image_url 项,并将每张图像的 role 设置为 reference_image

参考视频

  • 支持的格式:mp4mov
  • 支持的分辨率:480p720p
  • 每个视频时长:215
  • 参考视频最大数量:10
  • 所有参考视频的总时长最大值:15
  • 宽高比(宽/高):0.42.5
  • 宽度和高度:3006000 px
  • 总像素数:4096008295044
  • 每个视频最大大小:200 MB
  • 帧率:2460 FPS
容器格式 扩展名 MIME 类型 支持的编解码器
MP4 .mp4 video/mp4 视频:H.264/AVC、H.265/HEVC;音频:AAC、MP3
QuickTime .mov video/quicktime 视频:H.264/AVC、H.265/HEVC;音频:AAC、MP3

参考音频

  • 支持的格式:wavmp3
  • 每个音频文件时长:215
  • 参考音频文件最大数量:10
  • 所有参考音频文件的总时长最大值:15
  • 每个音频文件最大大小:15 MB
  • 最大请求体大小:64 MB
  • 不建议对大文件使用 Base64 编码

tools[]

字段 类型 必填 描述
type string 工具类型。目前仅支持 web_search

6. 输入示例

场景说明

  • 文本转视频 — 仅文本提示词,可配合 generate_audio 生成带音频视频。
  • 不带水印 — 设置 watermark: false 去除「AI Generated」水印。
  • web_search — 通过 tools 启用联网搜索,适用于需要实时信息的提示词。
  • 首帧 / 首尾帧 — 以单张或两张图像控制视频起止画面,分别设置 first_framelast_frame
  • 参考图像 — 提供 1–30 张参考图,role 均为 reference_image
  • need_review — 参考内容含人脸或版权 IP 时,对应项需设 need_review: true
  • 参考音频 — 结合参考图像与 reference_audio 音频引导生成。
  • 视频编辑 — 提供 reference_video 与参考图像,通过文本描述编辑指令。