图像生成调用指南
gpt-image-2 与 Gemini 系列绘图模型的调用方式、尺寸规则、画质档位与示例。
modelsok 提供多款 AI 绘图模型。基础地址 https://modelsok.com,使用 Authorization: Bearer <API Key> 鉴权。本页说明各模型的调用方式与实用建议。
可用模型
| 模型 | 说明 | 调用方式 |
|---|---|---|
gpt-image-2 | OpenAI 图像模型,输出尺寸与请求完全一致,最高 3840×2160 | OpenAI 兼容接口 |
gemini-2.5-flash-image-preview | Gemini 快速绘图 | OpenAI 兼容接口 / Gemini 原生 |
gemini-2.5-flash-image | Gemini 快速绘图 | Gemini 原生 |
gemini-3.1-flash-image-preview | Gemini 快速绘图 | Gemini 原生 |
gemini-3-pro-image-preview | Gemini 高质量绘图 | Gemini 原生 |
gpt-image-2
尺寸规则
输出尺寸严格等于请求的 size。size 需同时满足三个条件,否则接口会明确报错(不会静默返回其它尺寸):
| 条件 | 不满足时的报错 |
|---|---|
| 宽、高都必须是 16 的倍数 | Width and height must both be divisible by 16 |
| 总像素在 655,360 ~ 8,294,400 之间 | below / exceeds the current pixel budget |
| 最长边 ≤ 3840 | The longest edge must be less than or equal to 3840 |
常用尺寸参考:
| 比例 | 可用 size |
|---|---|
| 1:1 | 1024x1024、2048x2048 |
| 4:3 / 3:4 | 1024x768、2048x1536 / 768x1024、1536x2048 |
| 3:2 / 2:3 | 1536x1024 / 1024x1536 |
| 5:4 / 4:5 | 1280x1024 / 1024x1280 |
| 16:9 / 9:16 | 2048x1152、3840x2160 / 1152x2048、2160x3840 |
| 21:9 | 2688x1152 |
4096x4096 超出最长边限制会被拒绝。需要 4K 请使用 3840x2160。
画质档位
可选参数 quality,取值 low / medium / high,不传时默认为 low。档位同时影响画质、耗时与价格,建议按用途显式指定。
| quality | 相对价格 | 生成耗时(1024×1024) | 建议用途 |
|---|---|---|---|
low(默认) | 1× | 约 26 秒 | 草稿、批量预览 |
medium | 约 9× | 约 43 秒 | 日常成品 |
high | 约 36× | 约 109 秒 | 最终交付 |
文生图
curl https://modelsok.com/v1/images/generations \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-image-2",
"prompt": "一只吃竹子的小熊猫,扁平矢量风格",
"size": "1024x1024",
"quality": "medium"
}'图生图 / 图像编辑
通过 image 字段传入公网可访问的图片 URL即可,无需上传文件;传数组可提交多张参考图(最多 16 张)。
curl https://modelsok.com/v1/images/edits \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-image-2",
"prompt": "把杯身换成哑光黑,保持构图不变",
"image": "https://你的图床/reference.png",
"size": "3840x2160",
"quality": "medium"
}'gpt-image-2 不接受 response_format 参数,传入会返回 400 Unknown parameter: 'response_format'。
结果固定以 b64_json(Base64 图像数据)返回。
返回示例:
{
"created": 1780888000,
"data": [{ "b64_json": "iVBORw0KGgoAAAANSUhEUgAA..." }]
}Python 示例
import base64, requests
resp = requests.post(
"https://modelsok.com/v1/images/edits",
headers={"Authorization": f"Bearer {API_KEY}"},
json={
"model": "gpt-image-2",
"prompt": "一只吃竹子的小熊猫,扁平矢量风格",
"image": "https://你的图床/reference.png",
"size": "2048x2048",
"quality": "medium",
},
timeout=300,
)
data = resp.json()["data"][0]["b64_json"]
open("out.png", "wb").write(base64.b64decode(data))图生图单次耗时通常 20–110 秒(随
quality上升),建议客户端超时不低于 300 秒并做好重试。
Gemini 系列
方式一:OpenAI 兼容接口
适用于 gemini-2.5-flash-image-preview。
curl https://modelsok.com/v1/images/generations \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-image-preview",
"prompt": "一只吃竹子的小熊猫,扁平矢量风格",
"n": 1,
"size": "1024x1024",
"response_format": "b64_json"
}'建议使用
response_format: "b64_json"。默认url返回的是对象存储上的临时链接,可能在一段时间后失效、且偶有下载超时。用b64_json直接拿到图像数据,集成更稳定。该参数仅 Gemini 系列可用,gpt-image-2不支持。
方式二:Gemini 原生接口
适用于全部 Gemini 绘图模型。注意路径带尾部斜杠。
curl "https://modelsok.com/v1beta/models/gemini-2.5-flash-image:generateContent/" \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{ "parts": [{ "text": "一只蓝色卡通猫,白色背景" }] }]
}'注意:Gemini 原生接口返回的图片通常以 Markdown 图片链接的形式包含在文本里(位于
candidates[0].content.parts[].text,形如),而非inlineData。集成时需从文本中提取该 URL 再下载。如需直接拿到标准图像数据,请改用gemini-2.5-flash-image-preview的 OpenAI 兼容接口。
返回示例:
{
"candidates": [{
"content": {
"role": "model",
"parts": [{ "text": "" }]
}
}]
}计费
gpt-image-2 按 token 用量计费,费用由输出尺寸(size)、画质档位(quality)和参考图尺寸共同决定——出图越大、档位越高,费用越高。其余绘图模型按次计费(每次生成扣固定额度)。
具体单价以「模型广场」展示为准,价格随账号等级不同。