Seedance 2.5
Seedance 2.5 是一款基于参考图像、视频和音频进行多模态视频生成的工具,并支持视频编辑与扩展功能。
bytedance/seedance-2-5
Seedance 2.5 支持文本、图像、视频与音频的多模态输入,可用于文生视频、图生视频、参考内容生成及视频编辑等场景。调用方式为异步任务:提交请求获取 task_id,轮询状态后在成功时拉取结果。
1. 认证
API 使用 API Key 进行认证。在请求头中携带 Authorization: Bearer ${ICREAT_API_KEY}。
从 https://icreat.ai/hub/keys 获取你的 API Key。
2. 提交任务
POST /v1/task/submit/bytedance/seedance-2-5 · https://api.icreat.ai/v1/task/submit/bytedance/seedance-2-5
Body Parameters
content
content object[] — 必填。多模态内容数组,支持文本、图像、视频和音频引用的任意组合。详见下方 Schema 中 content[] 项说明。
可选字段
- generate_audio
boolean— 是否生成音频。 - ratio
string— 输出宽高比。支持16:9、4:3、1:1、3:4、9:16、21:9、adaptive;设为adaptive时模型自动选择最合适宽高比。 - resolution
string— 输出分辨率。支持480p、720p。 - duration
integer— 视频时长(秒)。接受4–30的整数,或-1让模型自动选择。 - watermark
boolean— 是否添加「AI Generated」水印。 - tools
object[]— 工具列表,目前仅支持web_search。
Returns
返回包含 task_id 的对象。使用该 ID 轮询任务状态并获取生成结果。
3. 轮询状态
POST /v1/task/query-status · https://api.icreat.ai/v1/task/query-status
curl --connect-timeout 10 --max-time 60 \
-X POST "https://api.icreat.ai/v1/task/query-status" \
-H "Authorization: Bearer ${ICREAT_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"task_id": "task-xxx"
}'服务器返回任务状态。当状态为 SUCCEEDED 时,可调用获取结果接口。
4. 获取结果
POST /v1/task/get-result · https://api.icreat.ai/v1/task/get-result
curl --connect-timeout 10 --max-time 60 \
-X POST "https://api.icreat.ai/v1/task/get-result" \
-H "Authorization: Bearer ${ICREAT_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"task_id": "task-xxx"
}'服务器返回该任务的输出(生成的视频等)。
5. Schema
顶层
API 使用多模态输入结构。content 是必填数组,支持文本、图像、视频和音频引用的任意组合。
| 字段 | 类型 | 必填 | 描述 |
|---|---|---|---|
content |
object[] | 是 | 多模态内容数组。请参见下方 schema |
generate_audio |
boolean | 否 | 是否生成音频 |
ratio |
string | 否 | 输出宽高比。支持的值:16:9、4:3、1:1、3:4、9:16、21:9 和 adaptive。设置为 adaptive 时,模型会根据输入自动选择最合适的宽高比 |
resolution |
string | 否 | 输出分辨率。支持的值:480p、720p |
duration |
integer | 否 | 视频时长,单位为秒。接受 4 到 30 的整数,或使用 -1 让模型自动选择时长 |
watermark |
boolean | 否 | 是否添加「AI Generated」水印 |
tools |
object[] | 否 | 要使用的工具列表 |
content[] 项
| 字段 | 类型 | 必填 | 描述 |
|---|---|---|---|
type |
string | 是 | 内容类型:text、image_url、video_url 或 audio_url |
text |
string | 条件必填 | 当 type=text 时必填。支持中文、英文、日文、印尼文、西班牙文和葡萄牙文 |
image_url |
object | 条件必填 | 当 type=image_url 时必填。格式:{"url":"https://..."} |
video_url |
object | 条件必填 | 当 type=video_url 时必填。格式:{"url":"https://..."} |
audio_url |
object | 条件必填 | 当 type=audio_url 时必填。格式:{"url":"https://..."} |
role |
string | 媒体必填 | 媒体角色:reference_image、reference_video、reference_audio、first_frame 或 last_frame |
need_review |
boolean | 否 | 是否将参考内容提交官方审核。当参考内容包含人脸或受版权保护的 IP 时,请将其设置为 true |
中文提示词不得超过 2000 个字符,英文提示词不得超过 2000 个单词。过长的提示词可能会稀释信息,导致模型忽略某些细节。
need_review 指南
- 如果参考内容包含人脸或受版权保护的 IP,请将
need_review设置为true;否则生成很可能失败。 - 如果需要审核的内容在提交时将
need_review设置为false,任务很可能失败。 - 如果不需要审核的内容在提交时将
need_review设置为true,生成可能需要更长时间。
参考图像
- 支持的格式:
jpeg、png、webp、bmp、tiff、gif、heic和heif - 宽高比(宽/高):
0.4–2.5 - 宽度和高度:
300–6000px - 每张图像最大大小:小于
30 MB - 最大请求体大小:
64 MB
支持以下模式:
- 首帧模式 — 提供一个
image_url项,并将其role设置为first_frame。 - 首尾帧模式 — 提供两个
image_url项,分别将role设置为first_frame和last_frame。 - 参考图像模式 — 提供 1–30 个
image_url项,并将每张图像的role设置为reference_image。
参考视频
- 支持的格式:
mp4、mov - 支持的分辨率:
480p、720p - 每个视频时长:
2–15秒 - 参考视频最大数量:10
- 所有参考视频的总时长最大值:
15秒 - 宽高比(宽/高):
0.4–2.5 - 宽度和高度:
300–6000px - 总像素数:
409600–8295044 - 每个视频最大大小:
200 MB - 帧率:
24–60 FPS
| 容器格式 | 扩展名 | MIME 类型 | 支持的编解码器 |
|---|---|---|---|
| MP4 | .mp4 |
video/mp4 |
视频:H.264/AVC、H.265/HEVC;音频:AAC、MP3 |
| QuickTime | .mov |
video/quicktime |
视频:H.264/AVC、H.265/HEVC;音频:AAC、MP3 |
参考音频
- 支持的格式:
wav、mp3 - 每个音频文件时长:
2–15秒 - 参考音频文件最大数量:10
- 所有参考音频文件的总时长最大值:
15秒 - 每个音频文件最大大小:
15 MB - 最大请求体大小:
64 MB - 不建议对大文件使用 Base64 编码
tools[] 项
| 字段 | 类型 | 必填 | 描述 |
|---|---|---|---|
type |
string | 是 | 工具类型。目前仅支持 web_search |
6. 输入示例
场景说明
- 文本转视频 — 仅文本提示词,可配合
generate_audio生成带音频视频。 - 不带水印 — 设置
watermark: false去除「AI Generated」水印。 - web_search — 通过
tools启用联网搜索,适用于需要实时信息的提示词。 - 首帧 / 首尾帧 — 以单张或两张图像控制视频起止画面,分别设置
first_frame、last_frame。 - 参考图像 — 提供 1–30 张参考图,
role均为reference_image。 - need_review — 参考内容含人脸或版权 IP 时,对应项需设
need_review: true。 - 参考音频 — 结合参考图像与
reference_audio音频引导生成。 - 视频编辑 — 提供
reference_video与参考图像,通过文本描述编辑指令。
