图像和视频
图像和视频
根据文本提示词和视觉参考生成并编辑出色的图像和视频。
概述
Image & Video 可根据简单的文本描述或参考图片创建高质量视觉内容。以任意风格生成静态图片或动态视频,再通过补充提示词反复优化、提升至高分辨率输出,甚至添加音频口型同步。
受监管或服务商要求影响,部分 Image & Video 模型和输入上传功能在美国受到限制。请查看各模型说明,了解具体 可用性。
免费版用户只能生成图片,每天最多发起 3 次图片请求。视频生成需要付费套餐。通过 API 生成需要 Pro 或更高套餐。对于 API 请求,ByteDance 模型默认禁用,使用前需获得明确批准。 企业版客户可联系支持团队申请访问权限。
主要功能
- 图片生成:通过文本提示词或参考图片创建高质量图片,可选择针对速度或质量优化的模型
- 视频生成:生成具有电影感动作、逼真物理效果和集成音频的动态视频。视频生成仅限付费套餐使用
- 迭代优化:通过补充提示词优化生成结果,并创建变体
- 增强工具:最高可将分辨率提升至 4 倍,并应用逼真的音频口型同步
- 多种模型:使用适合不同场景的专业模型,从快速迭代到可直接制作的内容
- 参考支持:通过起始帧、结束帧和风格参考引导生成。支持 JPG、PNG、WEBP 等多种图片文件格式
- 灵活导出:下载为独立文件,或直接导入 ElevenCreative Studio 项目
工作流程
创作流程分为 4 个阶段,带你从灵感到成品:
探索: 浏览社区作品,寻找灵感并学习有效的提示词。
生成: 在提示框中描述想创建的内容,选择模型并微调设置。
迭代和增强: 查看生成结果、创建变体,并应用放大和口型同步等增强功能。
导出: 下载完成的素材,或直接发送至 ElevenCreative Studio。
支持的下载格式
视频:
- MP4:编解码器 H.264、H.265。最高支持 4K 画质(通过超分)
图片:
- PNG:高分辨率、无损输出
模型
图像与视频提供针对不同用例优化的专用模型。每个模型都有独特能力,涵盖快速迭代到可用于生产的质量。
后期处理模型需要已有的生成结果,也可以上传自己的图片或视频文件。
企业版工作区管理员可以控制哪些图像和视频生成模型可供 工作区成员使用。默认情况下,企业版工作区的所有模型均处于禁用状态,必须由管理员 明确启用。了解更多:模型 审批。
对于 API 请求,ByteDance 模型默认禁用,使用前需要获得明确批准。 企业版客户可联系支持团队申请访问权限。
以下所有模型均可在图像与视频应用中使用。也可通过
图像与视频 API 调用的模型会在
API 下列出其 model_id;其余模型仅限应用内使用。
视频生成模型
Seedance 2.0
一款统一的多模态视频模型,可联合生成音频与视频,并提供导演级的表演、灯光、阴影和镜头运动控制,打造超写实电影级效果。
生成输入:
- 文本生成视频
- 起始帧
- 结束帧
- 图片参考
- 视频参考
- 音频参考
功能:
- 统一的多模态架构,单次生成即可同步生成音频和视频
- 行业领先的多模态参考与编辑能力,可同时接受文本、图片、音频和视频输入
- 出色的运动稳定性,呈现符合行业标准的电影级真实感
- 可对表演、灯光、阴影和镜头运动进行导演级创意控制
- 生成时长灵活,可从 4s 至 15s
- 原生声音控制,可针对每次生成启用或禁用音频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:480p、720p、1080p
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
适合用于:
- 需要音画同步的电影化叙事
- 严格遵循源图片、视频或音频的参考驱动内容
- 需要精细控制灯光和镜头工作的专业制作
费用: 根据所选设置和时长而定
可切换设置以调整积分消耗。
Seedance 2.0 在美国不可用。
Seedance 2.0 Fast
Seedance 2.0 更快、成本更低的版本,支持相同的多模态参考输入,输出最高为 720p。
生成输入:
- 文本生成视频
- 起始帧
- 结束帧
- 图片参考(最多 9 个)
- 视频参考(最多 3 个,合计 15s)
- 音频参考(最多 3 个,合计 15s)
功能:
- 与 Seedance 2.0 采用相同的参考处理方式,每次生成的参考总数上限为 12 个
- 帧和参考不可同时使用:使用起始帧或结束帧,或使用参考,不能两者兼用
- 生成时长灵活,可从 4s 至 15s
- 原生声音控制,可针对每次生成启用或禁用音频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:480p、720p
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
适合用于:
- 在完整分辨率渲染前迭代 Seedance 2.0 提示词
- 输出 720p 已足够的参考驱动片段
费用: 根据所选设置和时长而定
API: bytedance-seedance-v2-fast
Seedance 2.0 Fast 在美国不可用。
Seedance 2.0 Mini
最小的 Seedance 2.0 版本:速度约为 Seedance 2.0 的 2 倍,成本约为一半,支持相同输入并输出 720p。
生成输入:
- 文本生成视频
- 起始帧
- 结束帧
- 图片参考(最多 9 个)
- 视频参考(最多 3 个,合计 15s)
- 音频参考(最多 3 个,合计 15s)
功能:
- 与 Seedance 2.0 采用相同的参考处理方式,每次生成的参考总数上限为 12 个
- 帧和参考不可同时使用:使用起始帧或结束帧,或使用参考,不能两者兼用
- 生成时长灵活,可从 4s 至 15s
- 原生声音控制,可针对每次生成启用或禁用音频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:480p、720p
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
适合用于:
- 大批量草稿和预览
- 仍需音频和参考输入的成本敏感型工作流程
费用: 根据所选设置和时长而定
API: bytedance-seedance-v2-mini
Seedance 2.0 Mini 在美国不可用。
Seedance 2.5
Seedance 2.0 的后续版本,真实感更出色,最多支持 50 个图片、视频和音频参考,生成时长最长可达 30 秒。
生成输入:
- 文本生成视频
- 起始帧
- 结束帧
- 图片参考(最多 30 个)
- 视频参考(最多 10 个,合计 30s)
- 音频参考(最多 10 个,合计 30s)
功能:
- 各类参考之间没有总数上限;无需图片或视频即可使用仅音频参考
- 帧和参考不可同时使用
- 生成时长灵活,可从 4s 至 30s
- 提供起始帧或参考视频时,将采用其宽高比
- 原生声音控制,可针对每次生成启用或禁用音频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:480p、720p
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
适合用于:
- 需要与大量参考保持一致的长片段
- 由参考音频驱动的对话和表演场景
费用: 根据所选设置和时长而定
Seedance 2.5 不提供随机种子控制。
Seedance 2.5 在美国不可用。
Seedance 2.5 视频编辑
通过描述修改内容来编辑现有视频。输出时长和宽高比与输入视频保持一致。
生成输入:
- 要编辑的视频(必填,最长 30s)
- 描述编辑内容的文本提示词
- 图片参考(最多 30 个)
- 额外视频参考(最多 10 个,合计 30s)
- 音频参考(最多 10 个,合计 30s)
功能:
- 无时长控制:输出与输入视频时长一致
- 采用输入视频的宽高比
- 原生声音控制,可针对每次生成启用或禁用音频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:480p、720p
适合用于:
- 更改现有素材中的服装、道具、灯光或场景
- 保留原始运动的风格迁移
费用: 根据所选设置和时长而定
Seedance 2.5 视频编辑在美国不可用。
Seedance 2.5 视频延长
根据提示词和可选参考,从现有视频结尾处继续生成。
生成输入:
- 要延长的视频(必填,最长 30s)
- 描述续写内容的文本提示词
- 图片参考(最多 30 个)
- 额外视频参考(最多 10 个,合计 30s)
- 音频参考(最多 10 个,合计 30s)
功能:
- 延长时长可从 4s 至 30s
- 采用输入视频的宽高比
- 原生声音控制,可针对每次生成启用或禁用音频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:480p、720p
适合用于:
- 延长过早结束的镜头
- 将多个生成结果串联为更长的序列
费用: 根据所选设置和时长而定
Seedance 2.5 视频延长在美国不可用。
Kling 3.0
一款先进的视频模型,如同 AI 导演,可在复杂镜头运动中让角色、物品和场景保持高度一致。
生成输入:
- 文本生成视频
- 起始帧
- 结束帧
功能:
- 使用多角度图片或视频参考,高保真保留角色和场景
- 原生音画协同生成,支持多语言口型同步和环境音
- 生成时长灵活,可从 3s 至 15s
- 最多可同时生成 4 个变体
- 增强文本、流体动力学和复杂物理交互的处理能力
输出选项:
- 分辨率:仅 1080p
- 宽高比:16:9、1:1、9:16
适合用于:
- 需要视觉连贯性的角色驱动叙事
- 对特定文本渲染有要求的广告和素材
费用: 根据所选设置和时长而定
支持使用负面提示词进行精细控制。可针对每次生成启用或禁用声音。
Kling 3.0 在美国不可用。
Kling O3
一款高一致性视频模型,如同 AI 导演,可在复杂镜头运动中保留角色、物品和场景的身份特征。
生成输入:
- 文本生成视频
- 起始帧
- 结束帧
- 视频参考
- 图片参考
功能:
- 使用多角度参考,精确保留主角和物品的视觉身份
- 支持从 3s 至 15s 的无缝生成时长
- 单次最多生成 4 个变体
- 精准模拟元素互动和运动连贯性
- 原生支持针对每次生成启用或禁用音频
输出选项:
- 分辨率:仅 1080p
- 宽高比:16:9、1:1、9:16
适合用于:
- 需要严格视觉连贯性的角色驱动叙事
- 需要一致物品渲染的专业营销和品牌素材
费用: 根据所选设置和时长而定
可切换设置以调整积分消耗。
Kling O3 在美国不可用。
Kling O3 编辑
一款基于 O3 架构、由自然语言驱动的视频转视频编辑模型,无需手动遮罩或逐帧调整,即可实现角色替换、环境替换等复杂视觉转换。
生成输入:
- 源视频
- 图片参考(最多 4 个不同元素/角度)
- 文本描述(自然语言指令)
功能:
- 理解对话式提示词,在保留原始运动结构的同时替换主体或场景
- 在整个编辑过程中保持原始镜头角度、运动模式和空间关系
- 最多组合 4 个元素(包括正面和多角度图片),确保高保真角色一致性
- 可选择保留原始源音频,或针对每次生成输出静音视频
- 单次最多生成 4 个编辑变体
输出选项:
- 分辨率:取决于源视频
- 宽高比:与源视频一致
适合用于:
- 在保留原始动作的同时,高保真替换现有素材中的角色
- 完整转换场景环境(例如将白天的城市改为未来感夜景)
- 应用需严格遵循现有镜头动态的风格迁移
费用: 根据视频时长和所选设置而定
Kling O3 编辑在美国不可用。
Google Veo 3.1
用于生成高质量电影级视频的专业模型。
生成输入:
- 文本生成视频
- 起始帧
- 结束帧
- 图片参考
功能:
- 通过负面提示词实现出色质量和创意控制
- 完全集成且同步的音频
- 逼真的对话、口型同步和音效
- 固定时长:4s、6s 和 8s
- 支持批量创建,单次最多生成 4 个结果
- 专用声音控制
输出选项:
- 分辨率:720p、1080p
- 宽高比:16:9、9:16
适合用于:
- 可全面创意控制的高质量电影级视频生成
费用: 根据所选设置和时长而定
API: veo-3.1-generate-001
启用或禁用声音会改变生成所需积分。
Google Veo 3.1 Fast
针对快速预览和生成优化的高速模型,以更低延迟呈现更清晰的画面。
生成输入:
- 文本生成视频
- 起始帧
- 结束帧
功能:
- 支持负面提示词和专用声音控制的高级创意控制
- 固定时长:4s、6s 和 8s
- 支持批量创建,单次最多生成 4 个结果
- 精准模拟现实世界物理规律,呈现逼真的运动和交互
输出选项:
- 分辨率:720p、1080p
- 宽高比:16:9、9:16
适合用于:
- 快速迭代和 A/B 测试视觉效果
- 快节奏社交媒体内容创作
费用: 根据所选设置和时长而定
Google Veo 3.1 Lite
Veo 3.1 的高性价比高速版本,针对降低计算量下的快速生成进行了优化。
生成输入:
- 文本生成视频
- 起始帧
功能:
- 支持负面提示词和专用声音控制的精细创意控制
- 固定时长:4s、6s 和 8s
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:720p
- 宽高比:16:9、9:16
适合用于:
- 优先考虑速度和成本效益的大批量内容创作
- 快速探索概念和预览
费用: 根据所选设置和时长而定
Gemini Omni Flash 1.1
Google 具备物理感知能力的视频模型,支持原生音频、最高 4K 输出,以及帧插值和参考引导生成。
生成输入:
- 文本生成视频
- 起始帧
- 结束帧
- 图片参考(最多 10 个)
- 视频参考(最多 3 个,每个最长 10s)
功能:
- 帧和参考不可同时使用:可在帧之间插值,或使用参考引导
- 固定时长从 3s 至 10s;附加参考视频时,时长将遵循该视频
- 可出色呈现简短的屏幕文字和标签
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:360p、720p、1080p、4K
- 宽高比:16:9、9:16
适合用于:
- 包含清晰文字的说明视频和动态排版
- 具有物理依据的运动,以及在多个参考中保持一致的主体
费用: 根据所选设置和时长而定
Gemini Omni Flash 1.1 延长
使用 Gemini Omni Flash 1.1 从现有视频结尾处继续生成,总时长最长可达 40 秒。
生成输入:
- 要延长的视频(必填,最长 30s)
- 描述续写内容的文本提示词
功能:
- 延长时长从 3s 至 10s
- 宽高比遵循输入视频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:360p、720p、1080p、4K
适合用于:
- 延长 Gemini Omni Flash 生成结果且不出现明显剪切
- 构建超过单次生成时长限制的序列
费用: 根据所选设置和时长而定
Gemini Omni Flash
首个 Gemini Omni 视频模型:具备物理感知运动、原生音频,并以 720p 提供现有视频模型中最出色的屏幕文字渲染。
生成输入:
- 文本生成视频
- 图片参考(最多 8 个)
- 视频参考(1 个,最长 10s)
功能:
- 固定时长从 3s 至 10s;附加参考视频时,时长将遵循该视频
- 不支持起始帧或结束帧;请改用图片参考来固定主体
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:720p
- 宽高比:16:9、9:16
适合用于:
- 简短字幕、标题和带标签的说明内容
- 720p 下的多图片一致性
费用: 根据所选设置和时长而定
Seedance 1.5 Pro
专为创建动态、高保真序列升级优化的模型,具备更强的时间稳定性和关键帧间的精准转场控制。
生成输入:
- 文本转视频
- 起始帧
- 结束帧
功能:
- 无缝衔接起始帧和结束帧,生成连贯的多镜头序列
- 高保真呈现复杂动作,并保持环境一致性
- 支持 4 秒至 12 秒的固定生成时长
- 单次最多生成 4 个变体
- 原生支持按次生成启用或禁用音频
输出选项:
- 分辨率:420p、720p
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
适用场景:
- 需要在特定视觉基准之间保持稳定物理效果的叙事和动作场景
- 对起始和结束画面有严格要求的电影级转场和专业视频素材
费用: 取决于所选设置和时长
Seedance 1.5 Pro 已弃用。ByteDance 将于 2026 年 11 月 11 日停止该模型,且不再用于新的生成任务。请改用 Seedance 2.0 模型。Seedance 1.5 Pro 不在美国提供。
FLUX 3
Black Forest Labs 的视频模型,支持自然运动、多镜头场景、生成音频和视频延长。
生成输入:
- 文本转视频
- 起始帧
- 结束帧
- 要延长的视频(1 个,最长 15 秒)
功能:
- 视频延长不能与起始帧和结束帧同时使用
- 支持 5 秒至 20 秒的灵活生成时长
- 原生声音控制,可按次生成启用或禁用音频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:720p、1080p
- 宽高比:21:9、2:1、16:9、4:3、1:1、3:4、9:16
适用场景:
- 根据单个提示词创建多镜头场景
- 延长现有片段,并匹配其动作和音频
费用: 取决于所选设置和时长
MiniMax H3
MiniMax 旗舰视频模型,支持多模态参考、生成音频和最高 4K 输出。
生成输入:
- 文本转视频
- 起始帧
- 结束帧
- 图像参考(最多 9 个)
- 视频参考(最多 3 个,每个 2 秒至 15 秒,合计 15 秒)
- 音频参考(最多 3 个,每个 2 秒至 15 秒,合计 15 秒)
功能:
- 每次生成最多可使用 12 个参考;音频参考至少需要搭配 1 个图像或视频参考
- 帧和参考不能同时使用
- 支持 5 秒至 15 秒的灵活生成时长
- 生成同步音频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:480p、768p、2K、4K(2K 和 4K 均由 768p 超分辨率生成)
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
适用场景:
- 需要高分辨率交付、由参考素材驱动的场景
- 由参考音频驱动的对话片段
费用: 取决于所选设置和时长
MiniMax H3 不在美国提供。
MiniMax H3 Max
MiniMax H3 的近乎即时版本,拥有相同输入和出色美学效果,原生渲染分辨率最高为 768p。
生成输入:
- 文本转视频
- 起始帧
- 结束帧
- 图像参考(最多 9 个)
- 视频参考(最多 3 个,每个 2 秒至 15 秒,合计 15 秒)
- 音频参考(最多 3 个,每个 2 秒至 15 秒,合计 15 秒)
功能:
- 每次生成最多可使用 12 个参考;音频参考至少需要搭配 1 个图像或视频参考
- 帧和参考不能同时使用
- 支持 5 秒至 15 秒的灵活生成时长
- 生成同步音频
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:480p、768p
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
适用场景:
- 快速迭代提示词和参考素材
- 使用 MiniMax H3 渲染前预览
费用: 取决于所选设置和时长
MiniMax H3 Max 不在美国提供。
Kling O1
先进的推理视频模型,专为出色遵循提示词和模拟复杂物理世界而设计,利用高级逻辑处理理解并执行复杂指令。
生成输入:
- 文本转视频(描述)
- 起始帧和结束帧
- 视频参考
- 图像参考
功能:
- 能够出色理解多层提示词,并执行复杂的时序动作
- 利用图像和视频作为视觉锚点,保持角色和场景的高度一致性
- 出色模拟物理交互、因果关系和流体动力学
- 支持高质量生成 5 秒和 10 秒片段
- 单次最多生成 4 个变体
输出选项:
- 分辨率:取决于输入
- 宽高比:16:9、1:1、9:16
适用场景:
- 需要精准遵循长篇详细描述的高度具体创意概念
- 对物理真实感和多参考一致性要求极高的专业叙事
费用: 取决于所选设置和时长
Kling O1 不在美国提供。
Kling O1 Edit
由自然语言驱动的视频转视频编辑模型,无需手动蒙版或逐帧调整,即可实现角色替换和环境替换等复杂视觉变换。
生成输入:
- 源视频
- 图像参考(最多 4 个不同元素/角度)
- 文本描述(自然语言指令)
功能:
- 理解对话式提示词,在保留原始动作结构的同时替换主体或场景
- 在整个编辑过程中保留原始镜头角度、运动模式和空间关系
- 最多组合 4 个元素(包括正面和多角度图像),确保角色高度一致
- 可选择保留原始音频,或按次生成静音输出
- 单次最多生成 4 个编辑变体
输出选项:
- 分辨率:取决于源视频
- 宽高比:与源视频一致
适用场景:
- 在保留原始动作的同时,高保真替换现有素材中的角色
- 完整变换场景环境(例如,将白天城市变为未来夜景)
- 需要严格遵循现有镜头动态的风格迁移
费用: 取决于视频时长和所选设置
Kling O1 Edit 不在美国提供。
Kling 2.6 Motion Control
专为精准动作迁移设计的模型,可使用参考视频驱动角色图像,复现特定动作、手势和镜头角度。
生成输入:
- 角色图像(源)
- 动作视频(参考)
- 文本描述(可选)
功能:
- 选择 “Match Video” 可精准复现动作,选择 “Match Image” 可为角色添加新的创意动作
- 在 Match Video 模式下最长支持 30 秒,在 Match Image 模式下最长支持 10 秒
- 将参考素材中的人物动作高保真映射到静态角色
- 原生支持按次生成启用或禁用音频
- 单次最多生成 4 个变体
输出选项:
- 分辨率:取决于源素材
- 宽高比:取决于源素材
适用场景:
- 为自定义角色复现复杂编舞或特定动作
- 需要高动作保真度的长篇角色动画
- 由热门视频动作驱动的社交媒体内容
费用: 取决于所选设置和时长
Kling 2.6 Motion Control 不在美国提供。
Kling 3.0 Motion Control
基于 Kling 3.0 架构打造的精准动作迁移模型,可使用参考视频驱动角色图像,以更高保真度复现特定动作、手势和镜头角度。
生成输入:
- 角色图像(源)
- 动作视频(参考)
- 文本描述(可选)
功能:
- 选择 “Match Video” 可精准复现动作,选择 “Match Image” 可为角色添加新的创意动作
- 在 Match Video 模式下最长支持 30 秒,在 Match Image 模式下最长支持 10 秒
- 将参考素材中的人物动作高保真映射到静态角色
- 原生支持按次生成启用或禁用音频
- 单次最多生成 4 个变体
输出选项:
- 分辨率:取决于源素材
- 宽高比:取决于源素材
适用场景:
- 为自定义角色复现复杂编舞或特定动作
- 需要高动作保真度的长篇角色动画
- 由热门视频动作驱动的社交媒体内容
费用: 取决于所选设置和时长
Kling 3.0 Motion Control 不在美国提供。
Kling 2.6
为增强动作保真度和实现更流畅转场而优化的生成模型,在高速迭代和制作级视觉输出之间取得平衡。
生成输入:
- 文本转视频
- 起始帧(图像转视频)
功能:
- 增强动作动态:显著提升运动流畅度和真实物理交互效果
- 灵活声音控制:原生支持按次生成启用或禁用音频
- 批量创建:可同时生成最多 4 个变体
- 精细优化:通过支持负面提示词实现高级创意控制
- 固定时长:支持生成 5 秒和 10 秒视频
输出选项:
- 分辨率:取决于输入
- 宽高比:16:9、1:1、9:16
适用场景:
- 需要流畅角色动作的高动作量片段
- 高度遵循提示词的专业级社交媒体内容
费用: 取决于所选设置和时长
Kling 2.6 不在美国提供。
Kling 2.5
均衡且多功能的高质量全高清(Full HD)视频生成模型。
生成输入:
- 文本转视频
- 起始帧
功能:
- 擅长模拟复杂运动和真实物理效果
- 精确模拟流体动力学和表情
- 固定时长:5 秒和 10 秒
- 支持批量创建,单次最多生成 4 个结果
输出选项:
- 分辨率:1080p
- 宽高比:16:9、1:1、9:16
适用场景:
- 真实物理模拟和复杂运动
费用: 取决于所选设置和时长
目前不支持结束帧,无法提供图像参考,也不支持声音控制。
Kling 2.5 不在美国提供。
Runway Gen-4.5
提供先进的动作质量、提示词遵循度和视觉保真度,可生成电影级、高度逼真的视频。
生成输入:
- 文本转视频
- 起始帧(图像转视频)
功能:
- 出色的动作质量,提供行业领先的真实感和物理模拟效果
- 出色遵循提示词,精准控制复杂场景创作
- 高视觉保真度,输出电影级画面
- 可同时生成最多 4 个变体
输出选项:
- 分辨率:720p
- 宽高比:16:9、9:16
适用场景:
- 需要最高动作质量和真实感的电影级内容
- 要求精准遵循提示词的专业制作
- 高保真视觉叙事
费用: 取决于所选设置和时长
Runway Gen-4 Turbo
专为快速迭代和经济高效创作设计的先进视频模型,可生成高质量视频。
生成输入:
- 文本转视频
- 起始帧(图像转视频)
功能:
- 针对超快生成优化,结果生成速度最高可达之前版本的 4 倍
- 可精准控制角色动作、镜头角度和场景构图
- 擅长在动态场景中保持视觉连贯性和稳定性
- 支持 2 秒至 10 秒的生成时长
- 可同时生成最多 4 个变体
输出选项:
- 分辨率:720p
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
适用场景:
- 需要近乎即时反馈的快速原型制作和创意实验
- 需要快速交付高分辨率营销素材的专业项目
- 对镜头运动有特定要求的电影级内容
费用: 取决于所选设置和时长
Runway Gen-4 Aleph
先进的上下文视频模型,专为多任务视觉生成设计,可在保留源素材底层结构的同时进行复杂编辑。
生成输入:
- 源视频
- 参考图像
- 文本描述
功能:
- 在场景中无缝添加、移除或变换物体和主体,同时保持自然光线、阴影和透视效果
- 更改地点、季节和一天中的时间(例如,将阴天素材转为戏剧性的日落),并真实更新色温
- 通过简单自然语言提示词修改演员年龄和外观,或重新设置服装和主体纹理
- 将参考视频的特定动作和镜头路径应用到静态图像,实现精准动画控制
- 基于单个现有视频序列生成全新镜头角度,如反打镜头或低机位角度
- 支持精准绿幕处理(带边缘检测的隔离)、用于延续故事的下一镜头生成和美学风格迁移
- 可同时生成最多 4 个变体
输出选项:
- 分辨率:720p
- 宽高比:自动
适用场景:
- 数字减龄、重新布光和移除物体等专业视觉特效任务
- 快速制作电影原型,以及从单个镜头生成替代镜头覆盖
- 需要大幅改变环境或风格的创意营销内容
费用: 取决于所选设置和时长
Runway Aleph 2.0
Runway 的视频编辑模型:将现有视频转换为目标风格,同时保留动作和一致性。
输入:
- 源视频(必填,2 秒至 30 秒)
- 目标风格图像(必填)
- 描述编辑内容的文本提示词
功能:
- 输出时长和画面构图遵循源视频
- 由目标风格图像引导的风格迁移
- 支持批量创建,单次最多生成 4 个结果
适用场景:
- 为现有素材重新布光、改变风格或更换场景
- 将参考图像的风格应用到整个片段
费用: 取决于所选设置和时长
Runway Act-Two
专门的表演迁移模型,可将驱动视频中的动作、语音和面部表情映射到角色图像或视频参考上,为角色制作动画。
生成输入:
- 驱动表演(视频)
- 角色输入(图像或视频)
功能:
- 将细腻的面部表情、口型同步和同步音频直接从源演员迁移至任意角色
- 自动为静态角色图像添加次级动作和细微镜头抖动,使画面更自然
- 使用角色图像时,可精准切换是否启用身体和手部动作
- 可调整设置,在强烈情感表演与角色视觉一致性之间平衡
- 生成后可更改角色声音,同时与驱动表演完美对齐
输出选项:
- 分辨率:720p
- 宽高比:自动
适用场景:
- 通过真实的人类动作和语音让静态角色肖像生动起来
- 为非人类角色或风格化虚拟形象制作高保真表情动画
- 快速制作融合身体手势的口播内容
费用: 取决于所选设置和时长
Seedance 1 Pro
专为创建大幅运动和动作的动态多镜头序列而设计的模型。
生成输入:
- 文本转视频
- 起始帧
- 结束帧
功能:
- 高度稳定的物理效果和镜头间无缝转场
- 固定时长:3 秒、4 秒、5 秒、6 秒、7 秒、8 秒、9 秒、10 秒、11 秒和 12 秒
- 支持批量创建,单次最多生成 4 个结果
- 多种宽高比选项,提供最大创作灵活性
输出选项:
- 分辨率:480p、720p、1080p
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
适用场景:
- 需要稳定物理效果的叙事和动作场景
费用: 取决于所选设置和时长
宽高比和分辨率不影响生成积分,但时长会影响。
Seedance 1 Pro 不在美国提供。
LTX Audio-to-Video
基于 DiT 的基础模型,可一次生成同步视频和音频,确保连贯的语音和逼真的动作。
生成输入:
- 文本转视频
- 图像转视频
- 音频转视频
- 深度图转视频
功能:
- 同时生成对话、唇部动作和环境音频,无需外部工具即可实现精准同步
- 动态场景具备稳定动作、一致角色身份和出色的帧间连贯性
- 支持最长 20 秒的高保真同步生成
- 通过精细的负面提示词支持实现高级创意控制
- 单次最多生成 4 个变体
输出选项:
- 分辨率:720p、1080p
- 宽高比:16:9、4:3、1:1、3:4、9:16
适用于:
- 连贯语音和富有表现力的角色表演
- 需要整合环境音频和一致时序的叙事内容
- 采用复杂镜头感知动作逻辑的动态场景
费用: 取决于所选设置和时长
LTX 2 Pro
高保真生成模型,针对极致视觉细节和结构稳定性优化,可生成具有流畅动作的制作级 4K 输出。
生成输入:
- 文本转视频
- 起始帧(图像转视频)
功能:
- 优先保证视觉质量和一致性而非速度,确保长序列中结果稳定
- 支持 25 FPS 和 50 FPS,带来格外流畅、专业的动作效果
- 集成音视频生成,可切换开启或关闭声音
- 支持原生 1080p、2k 和 4k 输出,不损失细节
- 单次最多生成 4 个变体
输出选项:
- 分辨率:1080p、2k、4k
- 帧率:25 FPS、50 FPS
- 宽高比:16:9(默认)
- 时长:6 秒、8 秒、10 秒
适用于:
- 需要 4K 清晰度的高分辨率电影级制作
- 需要流畅 50 FPS 动作的专业内容
- 视觉稳定性和结构完整性至关重要的精细序列
费用: 取决于所选设置和时长
LTX 2 Retake
精准 AI 导演工具,可在不破坏连续性或重新生成整个序列的情况下,针对现有镜头中的对话、情绪和动作进行调整。
生成输入:
- 源视频
- 文本描述
功能:
- 修改特定片段,同时充分保留周围帧的上下文
- 改写台词,同时保持角色声音、表演和环境一致
- 多种编辑模式:可选择“音频和视频”、“仅音频”或“仅视频”,单独处理并重新生成镜头中的特定元素
- 新内容会自然继承原始动作、光照和风格,实现无缝过渡
- 可立即在单个镜头中尝试不同的角色反应、情绪节拍或镜头运动
- 同时最多生成 4 个变体,便于并排进行创意对比
输出选项:
- 宽高比:仅支持 16:9
适用于:
- 无需重拍或重新录制即可调整剧本和润色对话
- 修复后期制作中的情绪节拍或节奏问题
- 在单个营销素材中测试多种品牌信息和行动号召
费用: 取决于所选设置和时长
LTX 2 Fast
针对速度优化的生成模型,专为紧凑反馈循环和高速内容创作打造,可大幅缩短渲染时间并提供高分辨率视觉效果。
生成输入:
- 文本转视频
- 起始帧(图像转视频)
功能:
- 专为速度和快速迭代设计,可快速进行视觉实验并近乎即时预览
- 支持原生 1080p、2k 和 4k 输出,计算开销低于 Pro 模型
- 支持 25 FPS 和 50 FPS,在高速生成下也能呈现流畅动作
- 可快速生成最长 20 秒的同步音视频内容
- 原生支持为每次生成开启或关闭音频
- 同时最多生成 4 个变体
输出选项:
- 分辨率:1080p、2k、4k
- 帧率:25 FPS、50 FPS
- 宽高比:16:9(默认)
- 时长:6 秒、8 秒、10 秒、12 秒、14 秒、16 秒、18 秒、20 秒
适用于:
- 优先考虑速度而非极致细节的快速原型和创意探索
- 需要快速交付的大批量社交媒体内容
- 对不同视觉概念和动作风格进行 A/B 测试
费用: 取决于所选设置和时长
Wan 3.0
电影级视频模型,支持图像、视频和音频参考,可生成音频,最长可生成 30 秒视频。
生成输入:
- 文本转视频
- 起始帧
- 结束帧
- 图像参考(最多 10 个)
- 视频参考(最多 5 个,合计 15 秒)
- 音频参考(最多 5 个,合计 15 秒)
功能:
- 帧和参考不能同时使用
- 固定时长:5 秒、10 秒、15 秒、20 秒和 30 秒
- 原生声音控制,每次生成可开启或关闭音频
- 可选提示词增强
- 批量创建,单次最多生成 4 个内容
输出选项:
- 分辨率:480p、720p、1080p
- 宽高比:自动、16:9、4:3、1:1、3:4、9:16
适用于:
- 高度遵循提示词的长篇电影级镜头
- 带音频的参考驱动场景
费用: 取决于所选设置和时长
Wan 3.0 在美国不可用。
Wan 3.0 Prime
Wan 3.0 的更快版本,具有相同的输入和输出选项,适合创意构思。
生成输入:
- 文本转视频
- 起始帧
- 结束帧
- 图像参考(最多 10 个)
- 视频参考(最多 5 个,合计 15 秒)
- 音频参考(最多 5 个,合计 15 秒)
功能:
- 生成时间约为 Wan 3.0 的一半
- 固定时长:5 秒、10 秒、15 秒、20 秒和 30 秒
- 原生声音控制,每次生成可开启或关闭音频
- 批量创建,单次最多生成 4 个内容
输出选项:
- 分辨率:480p、720p、1080p
- 宽高比:自动、16:9、4:3、1:1、3:4、9:16
适用于:
- 最终渲染 Wan 3.0 前探索创意
- 对交付速度敏感的工作流程
费用: 取决于所选设置和时长
Wan 3.0 Prime 在美国不可用。
Wan 2.6
新一代电影级视频平台,采用统一多模态架构,提供制作级 1080p 内容,具备原生音频同步和智能多镜头编排功能。
生成输入:
- 文本转视频
- 起始帧(图像转视频)
- 视频参考(视频转视频)
- 音频参考(可选的背景音频或对话)
功能:
- 统一多模态系统:通过单一集成框架处理文本、图像、视频和音频,确保输出质量一致
- 原生音频同步:自动生成并将对话、旁白和环境音效与画面动作对齐
- 智能多镜头编排:自动将关联视频序列组织成连贯故事线,同时保持角色一致性
- 延长时长:支持以固定 5 秒、10 秒和 15 秒时长稳定生成高质量内容
- 高级创意控制:支持负面提示词以精细管理细节,并可批量创建最多 4 个变体
输出选项:
- 分辨率:720p、1080p
- 宽高比:16:9、4:3、1:1、3:4、9:16
适用于:
- 专业叙事创作和复杂多镜头电影级序列
- 需要集成高保真音频的社交媒体广告和营销内容
- 需通过视频参考严格保持视觉和动作一致性的角色驱动内容
费用: 取决于所选设置和时长
Wan 2.6 在美国不可用。
Wan 2.5 Video
多用途模型,可根据文本或起始图像生成电影级动作效果,并高度遵循提示词。
生成输入:
- 文本转视频
- 起始帧(图像转视频)
功能:
- 通过负面提示词和专用声音控制实现精细创意控制
- 固定时长:5 秒和 10 秒
- 批量创建,单次最多生成 4 个内容
输出选项:
- 分辨率:480p、720p、1080p
- 宽高比:16:9、1:1、9:16
适用于:
- 高度遵循提示词的电影级内容
费用: 取决于所选设置和时长
生成费用取决于所选设置。
Wan 2.5 Video 在美国不可用。
图像生成模型
GPT Image 2.5 Sunburst
OpenAI 的制作级图像模型,可实现高度精细的输出和精准编辑。
生成输入:
- 文本转图像
- 图像参考(最多 10 个)
功能:
- 提供从低到最高的 5 个质量等级
- 自定义分辨率,单边最高 3840px,宽高比最高 3:1
- 批量创建,单次最多生成 4 个内容
输出选项:
- 分辨率:1K、2K、4K 或自定义
- 宽高比:3:1、21:9、2:1、16:9、3:2、4:3、5:4、1:1、4:5、3:4、2:3、9:16、1:2、1:3
适用于:
- 对细节和保真度要求极高的最终素材
- 精准编辑现有图像
费用: 取决于所选设置和变体数量
GPT Image 2.5 Flare
快速版 GPT Image 2.5,与 Sunburst 提供相同控制选项,专为日常大批量生成调优。
生成输入:
- 文本转图像
- 图像参考(最多 10 个)
功能:
- 提供从低到最高的 5 个质量等级
- 自定义分辨率,单边最高 3840px,宽高比最高 3:1
- 批量创建,单次最多生成 4 个内容
输出选项:
- 分辨率:1K、2K、4K 或自定义
- 宽高比:3:1、21:9、2:1、16:9、3:2、4:3、5:4、1:1、4:5、3:4、2:3、9:16、1:2、1:3
适用于:
- 大批量图像生成
- 仍需 4K 和自定义尺寸的快速迭代
费用: 取决于所选设置和变体数量
GPT Image 2
先进的 AI 模型,专为精准图像生成设计,具备增强的文本渲染和高分辨率输出能力。
功能:
- 精准文本控制,可创建排版准确、清晰的图像
- 高分辨率 PNG 输出,适合专业和商业用途
- 支持多个图像参考来引导风格和构图
- 单次最多生成 4 张图像
输出选项:
- 宽高比:3:2、1:1、2:3
- 质量选项:低、中、高
适用于:
- 需要精准文本位置的营销视觉内容和设计素材
- 有高分辨率要求的专业内容
- 需要精准文字图像控制的创意项目
费用: 取决于所选设置和变体数量
API:gpt-image-2
Nano Banana 2
先进的 AI 图像生成模型,结合制作级质量和超快处理速度,并提升了世界知识和主体一致性。
功能:
- 无需放大即可原生输出 4K 分辨率,呈现清晰细节
- 最快仅需 1-2 秒即可闪电生成图像
- 通过先进推理和指令遵循能力,高度遵循提示词
- 可为模型图、标识和信息图生成清晰准确的多语言文本
- 多主体风格保持一致,在多个角色和对象之间保留身份特征
- 改进的世界知识,可更准确地生成场景
- 支持多个图像参考来引导生成
- 单次最多生成 4 张图像
输出选项:
- 宽高比:21:9、16:9、5:4、4:3、3:2、1:1、2:3、3:4、4:5、9:16
- 分辨率:最高 4K
适用于:
- 需要实时迭代的快速创意工作流程
- 保持角色身份一致的品牌内容和叙事创作
- 文本和排版准确的专业视觉内容
费用: 取决于所选设置和变体数量
Nano Banana 2 Lite
Nano Banana 2 的快速低成本版本,适用于以 1K 分辨率快速生成和编辑。
生成输入:
- 文本转图像
- 图像参考(最多 14 个)
功能:
- 固定 1K 输出,确保速度和成本稳定
- 与 Nano Banana 2 相同,最多支持 14 个图像参考
- 批量创建,单次最多生成 4 个内容
输出选项:
- 分辨率:1K
- 宽高比:21:9、16:9、5:4、4:3、3:2、1:1、2:3、3:4、4:5、9:16
适用于:
- 快速迭代和草稿
- 1K 已足够的大批量编辑
费用: 取决于所选设置和变体数量
Krea 2 Medium
来自 Krea AI 的多用途制作级图像生成模型,兼顾质量与速度,适合广泛的创意工作流程。
功能:
- 高保真图像生成,高度遵循提示词
- 支持多个图像参考来引导生成
- 单次最多生成 4 张图像
输出选项:
- 宽高比:16:9、4:3、1:1、3:4、9:16
适用于:
- 需要稳定质量的专业内容创作
- 多种创意概念的快速迭代
费用: 取决于所选设置和变体数量
Krea 2 Large
Krea AI 的旗舰图像生成模型,为专业制作工作流程提供极致视觉保真度和高级创意控制。
功能:
- 出色的细节和真实感,提供专业级输出
- 高级风格控制,支持多个图像参考
- 单次最多生成 4 张图像
输出选项:
- 宽高比:16:9、4:3、1:1、3:4、9:16
适用于:
- 高端商业和编辑类图像制作
- 需要极致保真度的复杂创意构图
费用: 取决于所选设置和变体数量
Recraft V4.1
以设计为核心的文本转图像模型,具备出色的提示词控制和简洁构图。
生成输入:
- 文本转图像
功能:
- 2K 输出使用 Pro 模型版本
- 批量创建,单次最多生成 4 个内容
输出选项:
- 分辨率:1K、2K
- 宽高比:2:1、16:9、3:2、14:10、4:3、5:4、1:1、4:5、3:4、10:14、2:3、6:10、9:16、1:2
适用于:
- 以版式为核心的图形、图标和海报
- 仅通过文本生成简洁构图
费用: 取决于所选设置和变体数量
Recraft V4
以设计为核心的图像模型,可匹配参考图像的风格。
生成输入:
- 文本转图像
- 风格参考(最多 10 个)
功能:
- 风格匹配控制:精准模式会高度贴近参考风格,灵活模式匹配整体外观
- 2K 输出使用 Pro 模型版本
- 批量创建,单次最多生成 4 个内容
输出选项:
- 分辨率:1K、2K
- 宽高比:2:1、16:9、3:2、14:10、4:3、5:4、1:1、4:5、3:4、10:14、2:3、6:10、9:16、1:2
适用于:
- 基于一组风格参考生成符合品牌调性的图形
- 插画和设计工作
费用: 取决于所选设置和变体数量
Seedream 5 Lite
来自字节跳动的轻量级快速生成图像模型,以较低计算需求提供高质量结果。
功能:
- 快速生成,便于快速创意迭代
- 支持多个图像参考来引导生成
- 单次最多生成 4 张图像
输出选项:
- 宽高比:16:9、4:3、1:1、3:4、9:16
适用于:
- 需要速度的大批量图像创作工作流程
- 快速概念探索和预览
费用: 取决于所选设置和变体数量
Seedream 5 Lite 在美国不可用。
Seedream 5 Pro
更高保真度的 Seedream 5 版本,适用于精确编辑、多语言文本和密集信息图。
生成输入:
- 文本转图像
- 图像参考(最多 10 张)
功能:
- 准确渲染多语言文本
- 可处理信息图和海报等密集布局
- 支持批量创建,每次最多生成 4 张
输出选项:
- 分辨率:1K、2K
- 宽高比:16:9、4:3、1:1、3:4、9:16
适用场景:
- 包含多语言大量文本的设计
- 严格遵循参考图的多图编辑
费用: 取决于所选设置和变体数量
Seedream 5 Pro 在美国不可用。
GPT Image 1.5
专为精准文本生成图像和复杂的无损照片编辑而设计的高速旗舰模型,可保留原始细节。
功能:
- 在保持源图像光照、构图和主体外观完整性的同时,可靠执行所请求的更改
- 支持添加、删除、组合和融合元素等复杂编辑任务
- 输出速度比上一代快最多 4 倍
- 每次最多生成 4 张图像
输出选项:
- 宽高比:3:2、1:1、2:3
- 质量选项:低、中、高
适用场景:
- 实用的照片调整,以及服装或发型的逼真虚拟试穿
- 保留输入图像精髓的概念性转换和风格滤镜
- 快速迭代文本转图像创意
费用: 取决于所选设置和变体数量
API:gpt-image-1.5
GPT Image 1
OpenAI 的第一代图像模型,具备良好的提示词遵循能力、清晰可读的文本和细致的编辑效果。
生成输入:
- 文本转图像
- 图像参考(最多 5 张)
功能:
- 3 个质量级别:低、中、高
- 支持批量创建,每次最多生成 4 张
输出选项:
- 宽高比:3:2、1:1、2:3
适用场景:
- 已围绕 GPT Image 1 输出构建的工作流程
- 标准分辨率下的简单编辑和图中文字任务
费用: 取决于所选设置和变体数量
API:gpt-image-1
Seedream 4.5
一款高性能多模态基础模型,将文本转图像合成、精确图像编辑和复杂多图合成整合为统一高效的框架。
功能:
- 原生支持快速生成最高 4K 分辨率的高保真图像
- 在基于参考输入的编辑任务中,出色保留面部特征、光照、色调和精细细节
- 准确识别并融合多张输入图像中的目标元素,实现可控且一致的结果
- 提供设计师级构图能力,为海报和品牌视觉准确清晰地渲染小号文字
- 每次最多生成 4 张图像
输出选项:
- 宽高比:16:9、4:3、1:1、3:4、9:16
- 分辨率:2K、4K
适用场景:
- 需要精确布局和排版的专业平面设计工作流程
- 需要严格遵循参考身份和光照的复杂照片编辑
- 使用多个视觉来源进行高分辨率创意合成
费用: 取决于所选设置和变体数量
Seedream 4.5 在美国不可用。
Kling O1 Image
具备高级推理能力的高保真图像生成模型,专为出色的提示词遵循能力和复杂构图中的精确视觉一致性而设计。
功能:
- 能够高准确度理解并执行复杂、多层次的文本描述
- 利用图像参考,在多次生成中保持主体身份、光照和美学风格
- 针对逼真纹理、复杂空间关系和专业级光照效果进行了优化
- 每次最多生成 4 张图像
输出选项:
- 宽高比:自动、16:9、9:16、1:1、4:3、3:4、3:2、2:3、21:9
- 分辨率:1K、2K
适用场景:
- 需要严格遵循详细技术文本提示词的专业创意素材
- 使用视觉参考进行高一致性图像编辑和角色设计
费用: 取决于所选设置和变体数量
Kling O1 Image 在美国不可用。
FLUX.2 [Pro]
面向专业工作流程的生产级图像生成与编辑模型,提供先进的视觉质量,专注于速度、精度和一致性。
功能:
- 可同时参考多张图像,在数百项素材中实现业界领先的角色和身份一致性
- 细节质量显著提升,从织物纹理到建筑元素均可媲美真实摄影
- 为复杂排版、UI 模型和信息图提供可直接用于生产的文本渲染
- 支持通过十六进制代码精确指定品牌颜色,无需近似处理
- 在复杂场景中确保准确的物体定位、逼真的物理效果、连贯的光照和正确的透视关系
- 针对结构化复杂指令优化,提高准确性和响应能力
- 每次最多生成 4 张图像
输出选项:
- 宽高比:16:9、4:3、1:1、3:4、9:16
- 分辨率:720p、1080p、2K
适用场景:
- 开展角色形象一致的营销活动,并在任何场景中准确放置产品
- 创建具有可读文本和一致视觉设计系统的界面模型
- 大规模生成产品摄影和情境化生活方式图片
费用: 取决于所选设置和变体数量
Nano Banana Pro
基于推理的专业级图像生成与编辑模型,专为高保真素材制作、高级创意控制和精确遵循指令而设计。
输入:
- 图像参考
- 文本描述(支持复杂的多层提示词)
功能:
- 在渲染前规划场景,实现符合物理规律的光照、准确的物体关系和出色的提示词遵循能力
- 以多种字体和手写风格生成清晰易读的多语言文本,适合制作吸睛的海报和产品模型
- 在多样化创意输出中,最多可保持 5 人及多个物体的高保真度和相似性
- 集成 Google Search,利用实际数据、现实世界知识及天气或体育等实时信息增强视觉效果
- 通过高级局部编辑工具调整相机角度、焦点和场景光照(例如将白天转换为夜晚)
- 出色的空间理解能力可生成准确的信息图、技术图表和演示幻灯片
- 每次最多生成 4 个变体
输出选项:
- 分辨率:1K、2K、4K
- 宽高比:自动、21:9、16:9、5:4、4:3、3:2、1:1、2:3、3:4、4:5、9:16
适用场景:
- 专业广告、品牌素材和高端电商产品摄影
- 教育讲解、数据驱动的信息图和复杂技术文档
- 快速制作具有一致角色或品牌身份的高分辨率视觉设计原型
费用: 取决于所选设置和变体数量
Nano Banana
用于直接根据文本提示词快速生成和编辑高质量图像的高速模型。
功能:
- 支持多个图像参考来引导生成
- 每次最多生成 4 张图像
输出选项:
- 宽高比:21:9、16:9、5:4、4:3、3:2、1:1、2:3、3:4、4:5、9:16
适用场景:
- 快速创建和迭代图像
费用: 取决于所选设置和变体数量
Runway Gen-4 Image
用于高保真图像生成的先进基础模型,提供前所未有的风格控制和视觉记忆,可保持跨场景的一致性。
功能:
- 使用输入图像锚定角色、风格或特定物体,在多个输出中保持专业级一致性
- 针对理解复杂自然语言描述进行了优化,可精确控制视觉细节、光照和情绪
- 可为多种使用场景生成高质量视觉内容,从电影分镜到专业产品摄影
- 每次最多生成 4 张图像
输出选项:
- 宽高比:16:9、4:3、1:1、3:4、9:16
- 分辨率:720p、1080p
适用场景:
- 确保主角在不同环境和光照处理下保持相同外观
- 快速制作高分辨率品牌素材、虚拟试穿和可规模化的产品可视化内容
- 通过图像参考锁定核心视觉身份,同时探索多样艺术方向
费用: 取决于所选设置和变体数量
Runway Gen-4 Image Turbo
专为速度打造的优化图像生成模型,在保持相同输出质量的同时,结果生成速度比标准 Gen-4 Image 快 2.5 倍。
功能:
- 优化处理支持快速探索创意,可在更短时间内生成高保真图像
- 最多上传 3 张参考图像,引导模型理解特定角色、环境和艺术风格
- 通过编码参考图像的特定视觉特征,解决视觉漂移问题,在多次生成中保持身份一致性
- 轻松将参考图像的美学、光照和纹理应用于全新的主体与场景
- 使用种子参数系统性探索变体,或精确复现特定输出
- 每次最多生成 4 张图像
输出选项:
- 宽高比:16:9、4:3、1:1、3:4、9:16
- 分辨率:720p、1080p
适用场景:
- 大规模快速制作针对平台优化的 Instagram Stories(9:16)或标准帖子(1:1)视觉内容
- 将品牌风格指南作为参考图像,在营销活动中保持严格的视觉身份
- 设计一致的角色姿势和场景,同时确保主角易于识别
- 通过基于参考的引导,准确创建多样化的生活方式和季节性产品图片
费用: 取决于所选设置和变体数量
Seedream 4
专用于生成多镜头序列,或包含大幅移动和动作场景的图像模型。
功能:
- 擅长创建物理效果稳定、过渡连贯的图像
- 支持多个图像参考来引导生成
- 每次最多生成 4 张图像
输出选项:
- 宽高比:自动、16:9、4:3、1:1、3:4、9:16
适用场景:
- 动作场景和动态构图
费用: 取决于所选设置和变体数量
Seedream 4 在美国不可用。
Wan 2.5 Image
Wan 2.5 的图像版本,具有出色的提示词保真度并支持参考图像。
生成输入:
- 文本转图像
- 图像参考(最多 2 张)
功能:
- 负面提示词和种子控制
- 支持批量创建,每次最多生成 4 张
输出选项:
- 宽高比:16:9、4:3、1:1、3:4、9:16
适用场景:
- 与 Wan 视频生成效果风格一致的静态图像
- 忠实遵循提示词的概念图像
费用: 取决于所选设置和变体数量
Wan 2.5 Image 在美国不可用。
FLUX.1 Kontext [Pro]
面向高级图像生成和编辑的专业模型,提供出色的场景连贯性和风格控制。
功能:
- 基于图像的风格控制,需要参考图像来引导视觉美学
- 每次最多生成 4 张图像
输出选项:
- 宽高比:21:9、16:9、4:3、3:2、1:1、2:3、3:4、4:5、9:16、9:21
适用场景:
- 对风格有精确要求的专业内容
费用: 取决于所选设置和变体数量
口型同步模型
Creatify Aurora
一款先进的扩散 Transformer(DiT)模型,可根据音频和文本引导渲染超逼真、反应自然的虚拟形象。
生成输入:
- 虚拟形象(源图像)
- 语音(音频文件)
- 文本描述(引导)
功能:
- 不仅能进行基础口型同步,还可实现感知上下文的眨眼、呼吸和自然面部表情
- 根据声音语调和抑扬顿挫自动同步手部和全身动作,呈现影棚级效果
- 准确解读声音强度和音高,生成与表演匹配的情绪表达
- 即使在长篇对话或音乐表演中,也能保持高保真角色形象和连贯行为
- 针对多种场景优化,包括侧角演示、播客式对话和风格化动画
- 每次最多生成 4 个变体
输出选项:
- 分辨率:480p、720p
适合用于:
- 专业虚拟形象视频广告和营销内容
- 高保真虚拟叙事和富有表现力的音乐演出
- 需要角色持续出镜的长篇教育或培训视频
费用: 取决于输入、设置和时长
API:creatify-aurora
Veed Fabric
一款快速、精准的图像转视频口型同步模型,可让静态图像与提供的音频匹配并动起来。
输入:
- 源图像
- 语音音频文件
功能:
- 为源图像的嘴部和面部表情添加动画,使其与提供的音频匹配
- 从静态图像创建高保真的“说话”视频
- 专用于口型同步,不是完整的视频生成模型
适合用于:
- 从静态图像创建说话的虚拟形象
- 为角色肖像添加对白
- 专业虚拟形象内容工作流
费用: 取决于输入、设置和时长
为获得最佳效果,图像中应包含可检测的人物。
HeyGen Avatar 4
HeyGen 最新的虚拟形象模型,可根据单张图像和音频输入生成高度逼真、富有表现力的真人出镜视频。
输入:
- 源图像
- 语音音频文件
功能:
- 高保真地为面部表情和嘴部动作添加动画,使其与提供的音频匹配
- 生成自然的头部动作和细微表情,呈现栩栩如生的效果
- 专用于口型同步,不是完整的视频生成模型
适合用于:
- 专业发言人和演示者视频
- 批量创建个性化虚拟形象内容
- 需要角色持续出镜的营销和培训视频
费用: 取决于输入、设置和时长
为获得最佳效果,图像中应包含清晰可见的人脸。
Sync 3
Sync 最新一代视频口型同步模型,可为多种内容类型提供影棚级同步效果。
生成输入:
- 源视频
- 语音音频
功能:
- 高精度口型同步,保留独特的面部细节、自然牙齿和皮肤纹理
- 针对所有内容类型优化,包括真人实拍、3D 动画和 AI 生成视频
- 视频转视频口型同步工具,不是完整的视频生成器
适合用于:
- 影视和广告的专业配音与本地化
- 增强或修正任何视频格式中的对白
- 大批量内容翻译工作流
费用: 取决于输入、设置和时长
为获得最佳效果,视频中应包含可检测的人物。
Sync Lipsync 2 Pro
一款先进的视频编辑模型,可实现影棚级口型同步,在扩展至高分辨率输出时保留独特面部细节。
生成输入:
- 源视频
- 语音音频
功能:
- 集成先进超分技术,支持 4K 输出,同时保持清晰自然的纹理
- 保留自然牙齿、雀斑、妆容和复杂面部毛发等独特面部特征,不损失清晰度
- 针对所有内容类型优化,包括真人实拍、3D 动画和 AI 生成视频
- 无需针对说话者训练或微调模型,即可立即生成富有表现力的同步效果
- 最多同时生成 4 个变体
适合用于:
- 影视和高端广告的专业配音及本地化内容
- 增强或修正 3D 动画和 AI 生成角色的对白
- 需要像素级面部一致性和细节的高分辨率项目
费用: 取决于输入、设置和时长
OmniHuman 1.5
一款专用于生成极度逼真人类口型同步效果的实用模型。
输入:
- 静态源图像
- 语音音频文件
功能:
- 为源图像的嘴部添加动画,使其与提供的音频匹配
- 从静态图像创建高保真的“说话”视频
- 专用于口型同步,不是完整的视频生成模型
适合用于:
- 创建说话的虚拟形象
- 为静态图像添加对白
- 专业配音工作流
费用: 取决于输入、设置和时长
为获得最佳效果,图像中应包含可检测的人物。
OmniHuman 1.5 在美国不可用。
Veed Lipsync
一款快速、经济且精准的实用模型,可为视频应用逼真的口型同步。
输入:
- 源视频
- 新的语音音频文件
功能:
- 重新生成源视频中的嘴部动作,使其与新音频匹配
- 视频转视频口型同步工具,不是完整的视频生成器
适合用于:
- 大批量、高性价比配音
- 翻译内容
- 修正视频片段中的音频,获得逼真效果
费用: 取决于输入、设置和时长
为获得最佳效果,视频中应包含可检测的人物。
Veed Lipsync 2.0
Veed Lipsync 的高质量后继版本,可为现有视频应用逼真的口型同步。
输入:
- 源视频
- 新的语音音频文件
功能:
- 重新生成源视频中的嘴部动作,使其与新音频匹配
- 视频转视频口型同步工具,不是完整的视频生成器
- 支持批量创建,每次最多生成 4 个结果
适合用于:
- 输出质量比成本更重要的配音和翻译
- 修正成片片段中的对白
费用: 取决于输入、设置和时长
为获得最佳效果,视频中应包含可检测的人物。
实用模型
Topaz Upscale
一款专用于图像和视频超分的实用模型,可将分辨率和细节最高提升至 4 倍。
功能:
- 用于处理现有媒体的增强工具
- 在保留自然纹理并尽量减少伪影的同时增大媒体尺寸
- 提供精细的超分倍率:1x、1.25x、1.5x、1.75x、2x、3x、4x
- 视频专属:灵活的帧率控制(保留源帧率或转换为 24、25、30、48、50 或 60 fps)
适合用于:
- 提升生成媒体的质量
- 修复旧视频素材或照片
- 为高分辨率显示设备准备素材
费用: 取决于输入
背景移除
移除图像背景,并返回带 Alpha 透明度的图像。
输入:
- 源图像
功能:
- 无需提示词
- 每次运行仅输出一个结果
适合用于:
- 产品抠图和合成
- 准备主体,供其他生成任务用作参考
费用: 取决于输入
Runway Ruby
将标准动态范围视频转换为 HDR。
输入:
- 源视频(最长 30 秒)
功能:
- 无需提示词
- 每次运行仅输出一个结果;时长和画幅遵循源视频
适合用于:
- 为 HDR 显示设备准备素材
- 重新调色生成的视频以便交付
费用: 取决于视频时长