Gemini Omni Flash Text-to-Video


Gemini Omni Flash Text-to-Video 是 Google DeepMind 发布的 Gemini Omni 系列首款统一多模态大模型。该模型深度融合 Gemini 的逻辑推理能力与 Veo 的视觉生成技术,支持原生"任意输入到任意输出",能够通过纯文本提示词直接生成带音频的 24 FPS 高质量视频。模型最高支持 1080P 及 4K 超采样输出,支持 16:9 与 9:16 画幅及 3–10 秒单次生成,内置 SynthID 数字水印,并支持多轮对话式视频编辑与上下文保持,适用于短剧创作、商业广告、影视特效及多模态 Agent 工作流。

Gemini Omni Flash Text-to-Video

Gemini Omni Flash Text-to-Video 是 Google DeepMind 发布的 Gemini Omni 系列首款统一多模态大模型。该模型深度融合 Gemini 的逻辑推理能力与 Veo 的视觉生成技术,支持原生"任意输入到任意输出",能够通过纯文本提示词直接生成带音频的 24 FPS 高质量视频。模型最高支持 1080P 及 4K 超采样输出,支持 16:9 与 9:16 画幅及 3–10 秒单次生成,内置 SynthID 数字水印,并支持多轮对话式视频编辑与上下文保持,适用于短剧创作、商业广告、影视特效及多模态 Agent 工作流。

Base URL

https://api.icreat.ai

认证

所有 API 请求需要通过 API Key 进行认证。您可以在控制台获取 API Key。

export ICREAT_API_KEY="your-api-key-here"

HTTP 请求头

import os

API_KEY = os.environ.get("ICREAT_API_KEY")
headers = {
    "Content-Type": "application/json",
    "Authorization": "Bearer " + API_KEY,
}

保护好您的 API Key

切勿在客户端代码或公开仓库中暴露您的 API Key。请使用环境变量或后端代理。

代码示例

图片/视频生成采用三段式异步调用:先提交任务获取 task_id,再轮询任务状态,最后在状态为 SUCCEEDED 时获取生成结果。以下示例使用同一 task_id 串联三个步骤。

1. 提交任务

向提交接口发送生成请求。

POST/v1/task/submit/atlas/gemini-omni-flash/text-to-video

2. 轮询状态

使用 task_id 查询任务进度。响应体仅包含 status 字段。

POST/v1/task/query-status

3. 获取结果

任务成功后拉取最终输出。

POST/v1/task/get-result

输入参数

提交任务 — 输入参数

以下参数在提交任务请求体中被接受。

总计: 4 必填: 3 可选: 1

contentarray[object]必填

多模态输入内容数组。

resolutionstring必填

视频分辨率。

durationinteger必填

视频时长(秒)。

ratiostring

宽高比。

轮询状态 — 输入参数

总计: 1 必填: 1 可选: 0

task_idstring必填

提交任务接口返回的任务 ID。

获取结果 — 输入参数

总计: 1 必填: 1 可选: 0

task_idstring必填

提交任务接口返回的任务 ID。

输出参数

提交任务 — 输出参数

总计: 1

task_idstring

提交任务接口返回的任务 ID。

轮询状态 — 输出参数

总计: 1

statusstring

当前任务状态。当状态为 SUCCEEDED 时可获取结果。

获取结果 — 输出参数

响应体为资源对象数组(array[object])。

总计: 3

typestring

资源类型,视频模型为 Video

urlstring

预览/访问 URL。

download_urlstring

下载 URL。

LLM友好的提示词

以下是一段 LLM 友好的 Markdown 提示词,可复制到 Cursor、ChatGPT 等 AI 助手中,帮助 AI 理解本模型的 API 接入方式、调用流程与关键参数。点击「复制LLM提示词」按钮或下方代码块均可复制全文。

# atlas/gemini-omni-flash/text-to-video

> Gemini Omni Flash Text-to-Video 是 Google DeepMind 发布的 Gemini Omni 系列首款统一多模态大模型。

## 概述

通过 iCreat 三段式异步任务 API 提交生成请求,轮询任务状态后在成功时获取视频资源 URL。

## API 信息

- **Base URL**:`https://api.icreat.ai`
- **Submit endpoint (POST)**:`/v1/task/submit/atlas/gemini-omni-flash/text-to-video`
- **Poll endpoint (POST)**:`/v1/task/query-status`
- **Get result endpoint (POST)**:`/v1/task/get-result`
- **Model ID**:`atlas/gemini-omni-flash/text-to-video`
- **认证**:`Authorization: Bearer ${ICREAT_API_KEY}`

## 调用流程

1. **Submit**:POST submit 路径,Body 见输入要点;响应 `{ "task_id": "..." }`
2. **Poll**:POST `/v1/task/query-status`,Body `{ "task_id": "..." }`;响应**仅** `{ "status": "SUBMITTED|SUCCEEDED|FAILED" }`
3. **Get result**:`status` 为 `SUCCEEDED` 时 POST `/v1/task/get-result`;响应为顶层数组,`type` 为 `Video` 时读取 `url` 或 `download_url`

### 输入要点

- 请求体以 `content` 多模态数组为核心,配合分辨率/时长等参数
- `resolution`(必填):视频分辨率。
- `duration`(必填):视频时长(秒)。
- `ratio`(可选):宽高比。

### 输出要点

- 轮询:只看 `status`
- 结果:顶层 `[{ "type": "Video", "url": "...", "download_url": "..." }]`

## 注意事项

- 三段式须用同一 `task_id` 串联;不可跳过轮询
- `FAILED` 为终态,需排查请求参数或参考内容