Deepseek V4 Flash 0731


DeepSeek V4 Flash 是 DeepSeek 推出的效率优化型混合专家(MoE)模型,拥有 2840 亿总参数,每个 token 激活 130 亿参数,并提供 100 万 tokens 的上下文窗口。它专为快速推理和高吞吐量任务而设计,在保持出色成本效率的同时,提供强大的推理与编程能力。 其混合注意力架构可实现高效的长上下文处理。该模型支持 **high** 和 **xhigh** 推理级别,其中 **xhigh** 代表最高推理强度。它非常适合对响应速度、可扩展性和成本效率有较高要求的编程助手、对话系统及智能体工作流。

Deepseek V4 Flash 0731

DeepSeek V4 Flash 是 DeepSeek 推出的效率优化型混合专家(MoE)模型,拥有 2840 亿总参数,每个 token 激活 130 亿参数,并提供 100 万 tokens 的上下文窗口。它专为快速推理和高吞吐量任务而设计,在保持出色成本效率的同时,提供强大的推理与编程能力。

其混合注意力架构可实现高效的长上下文处理。该模型支持 highxhigh 推理级别,其中 xhigh 代表最高推理强度。它非常适合对响应速度、可扩展性和成本效率有较高要求的编程助手、对话系统及智能体工作流。

Base URL

https://api.icreat.ai/llm/openai/v1

认证

所有 API 请求需要通过 API Key 进行认证。您可以在控制台获取 API Key。

export ICREAT_API_KEY="your-api-key-here"

HTTP 请求头

import os

API_KEY = os.environ.get("ICREAT_API_KEY")
headers = {
    "Content-Type": "application/json",
    "Authorization": "Bearer " + API_KEY,
}

保护好您的 API Key

切勿在客户端代码或公开仓库中暴露您的 API Key。请使用环境变量或后端代理。

代码示例

本模型通过 OpenAI 兼容的 Chat Completions 接口调用,支持流式非流式两种模式。请求体中将 stream 设为 false(默认)时,服务端一次性返回完整 JSON 响应;设为 true 时,以 Server-Sent Events(SSE)逐块推送增量内容,适合实时展示生成过程。

POST/chat/completions

输入参数

以下参数在请求体中被接受。

总计: 6 必填: 2 可选: 4

modelstring必填

用于补全的模型 ID。须填写 iCreat 的 model_code(本篇模型为 deepseek-v4-flash,非厂商原始模型名)。

Example: "deepseek-v4-flash"

messagesarray[object]必填

构成对话的消息列表。

max_tokensinteger

生成的最大 token 数。

temperaturenumber

采样温度,0–2。

streamboolean

若为 true,则以 Server-Sent Events 流式返回。

thinkingobject

扩展思考模式配置(若模型支持)。

输出参数

API 返回兼容 OpenAI Chat Completions 的响应格式。

总计: 6

idstring

补全的唯一标识符。

objectstring

对象类型,固定为 chat.completion

createdinteger

补全创建时的 Unix 时间戳。

modelstring

用于补全的模型 ID。

choicesarray[object]

补全选项列表。

usageobject

Token 使用统计。

LLM友好的提示词

以下是一段 LLM 友好的 Markdown 提示词,可复制到 Cursor、ChatGPT 等 AI 助手中,帮助 AI 理解本模型的 API 接入方式、调用流程与关键参数。点击「复制LLM提示词」按钮或下方代码块均可复制全文。

# deepseek-v4-flash

> DeepSeek V4 Flash 是 DeepSeek 推出的效率优化型混合专家(MoE)模型,拥有 2840 亿总参数,每个 token 激活 130 亿参数,并提供 100 万 tokens 的上下文窗口。

## 概述

通过 iCreat OpenAI 兼容 Chat Completions API 进行对话补全,支持流式与非流式、扩展思考模式。

## API 信息

- **Base URL**:`https://api.icreat.ai/llm/openai/v1`
- **Endpoint (POST)**:`/chat/completions`
- **Model ID**:`deepseek-v4-flash`
- **认证**:`Authorization: Bearer ${ICREAT_API_KEY}`

## 调用流程

单次 POST;`stream: false` 返回完整 JSON,`stream: true` 以 SSE 流式返回。

### 输入要点

- `model`(必填):iCreat model_code `deepseek-v4-flash`
- `messages`(必填):对话消息列表
- 常见可选:`max_tokens`(最大输出 token)、`temperature`(采样温度)、`stream`(流式开关)、`thinking`(扩展思考模式)

### 输出要点

- 从 `choices[0].message.content` 读取回复

## 注意事项

- `model` 必须使用 iCreat model_code
- 其余字段与 OpenAI Chat Completions 协议一致