如何使用图生视频 AI 生成器
图生视频从一张真实存在的静态画面开始。这种 AI 图片动画与首帧生成视频工作流,由图片确定主体、构图、色彩、材质和开场视角,提示词说明接下来谁要动、环境如何变化、镜头怎么移动,以及哪些细节不能漂移。相比完全从文字建立场景,这种方式能让开场视觉更明确,但它也不是逐帧手工动画,模型仍需要根据有限的画面证据推断后续运动。
不同图生视频模型需要的图片并不相同。界面会标出哪些图片必须上传、哪些可以选填,并在缺少必填图片时阻止提交。根据所选模型,上传内容可能包括一张起始图、开始帧和结束帧、角色或物体图片,或者其他参考素材。并非所有模型都支持这些输入,因此请以当前界面为准。
- 01
选择清晰的源图
优先使用主体明确、边缘清楚、构图合理,并为计划动作留有空间的图片。 - 02
检查当前模型需要哪些图片
阅读上传区域标签,补齐所有必填图片。只有模型显示结束帧、元素或参考素材时才使用这些入口。 - 03
把提示词用于描述变化
写清主体动作、环境运动、镜头方向、节奏和保持项,不要把提示词全部浪费在重复原图内容上。 - 04
复核模型参数
查看当前可用的时长、清晰度、比例和音频设置。有些模型从源图推导画幅,有些模型会提供显式选择。 - 05
提交并在工作区跟踪
确认积分和输入后生成。成功提交会打开统一工作区,用于查看任务进度和完成结果。
为图生视频 AI 生成器准备起始帧
源图会成为短片的第一帧,也决定开场构图。主体层次越清楚,模型越容易判断哪些内容需要保持、哪些边缘属于同一个物体,以及动作应该从哪里开始。画面过于拥挤、人物肢体互相遮挡,或商品边缘被反光遮住,都会增加后续画面出错的可能。
所谓准备源图,并不要求每张图片都像商业棚拍,而是让构图与运动目标一致。人物要向右走,就在右侧留出空间;镜头要拉远,就不要使用完全没有环境线索的极端裁切;希望动作轻微,就尽量避免本身已经严重模糊或姿态失衡的画面。
让主体一眼可辨
人物、商品或插画角色应与背景有基本分离。肢体大面积重叠、透明材质、复杂反射、多个同等重要主体,都会增加运动时的歧义。
为动作方向留下空间
人物转头需要脸部周围有空间,车辆前进需要运动方向留白,环绕镜头需要可理解的立体结构,背景揭示需要源图提供一定环境信息。
保护商品与设计细节
商品、Logo、服装、建筑或品牌版式中,先明确哪些形状和区域必须稳定。正面或三分之四视角通常比强烈透视和畸变角度更容易保持。
不要把修复问题全部交给动画步骤
压缩噪点、极小人脸、不可读文字和严重运动模糊都会成为模型参考的一部分。尽量使用当前能获得的清晰版本。
如何描述主体动作和镜头运动
图生视频提示词应重点说明画面如何随时间变化。先写主体做什么,再写环境如何变化、镜头怎样移动、动作速度,以及哪些主体特征必须保持。风格和氛围可以补充,但不能代替动作描述。只写“电影感”“更有生命力”或“让它动起来”,并没有说明接下来具体会发生什么。
当一致性最重要时,先从小动作开始。轻微转头、呼吸、布料摆动、雾气移动、光线变化或缓慢推镜,对源图几何结构的要求通常低于大幅转身、快速环绕和剧烈变形。稳定版本成功后,再逐步放大运动。
主体动作
指出哪个部位移动、向什么方向、速度如何。例如人物看向左侧并抬起一只手;水杯保持不动,表面凝结水珠缓慢下滑;插画中的鸟逐渐展开翅膀。
环境运动
加入符合场景的次级变化,如风吹发丝和布料、反射移动、树叶晃动、粒子穿过光束。次级运动应增强尺度和氛围,而不是抢走主体。
镜头行为
说明固定、推近、拉远、横移、摇摄、俯仰或轻微环绕。源图透视越强,越要选择与现有几何关系相符的镜头运动。
一致性约束
明确少量保持项,例如保留人物面部、商品轮廓、Logo 区域、服装、建筑结构或背景布局。约束越具体,越容易执行。
从起始画面到可控的动态镜头
动态提示词
镜头缓慢向场景内部推近,云层与树木产生自然的环境运动,保持山体结构稳定,节奏克制,保留温暖日出光线。保持寺庙岛屿和原始构图。
源图负责确定主体、构图和色彩;提示词集中说明环境运动、一个镜头行为、节奏,以及不能漂移的建筑结构。

起始帧、结束帧与参考控制
不同图生视频模型接受的素材并不相同:有的只需要一张起始图,有的可以添加结束帧,还有的支持角色、物体、图片、视频或音频参考。页面只显示当前模型支持的上传项,并在提交前检查数量、大小和时长等限制。
结束帧不是普通的第二张灵感图。它表达短片最终要到达的状态,因此开始与结束之间需要存在可理解的连续关系。如果人物身份、镜头角度、光线和场景布局同时完全改变,短片很难自然连接。使用结束帧时,应把目标缩小为一条明确过渡。
只用起始帧的情况
当开场人物、商品或构图必须确定,但结尾可以由模型根据运动提示词自由发展时,单图工作流最直接,也最适合先测试一个新动作。
结束帧有帮助的情况
当目标姿态、相机位置、商品状态或环境变化必须明确,并且当前模型确实提供结束帧时,可以加入。两张图的主体与空间关系越接近,过渡越容易理解。
元素或参考素材有帮助的情况
只有在当前模型支持并且确实需要解决角色或对象一致性问题时再使用。输入越多,控制信息越丰富,也越可能互相冲突,所以简单任务应从最少必填素材开始。
让参数与源图构图保持一致
源图与设置应描述同一个镜头。如果模型根据图片推导画幅,上传前就要有意识地裁切;如果模型提供比例选择,则要确认新比例不会破坏原构图。横向场景压进窄竖屏时,往往需要重新裁切或减少镜头运动,而不是只靠提示词解决。
时长也决定动作复杂度。短片适合一次转头、一道光扫过、一个小幅环绕或一次环境揭示。更长的可选时长可以容纳更完整过程,但不会自动让拥挤提示词变得清楚。清晰度和音频仍然按模型变化。
- 切换模型后重新检查需要上传的图片,因为上传项可能随模型发生变化。
- 确认比例是由源图推导还是可显式选择,再决定裁切与运动方向。
- 让动作节点数量适配当前时长,不要让短片同时承担多个转场。
- 只有当前模型显示清晰度选项时才进行选择,不把某种输出规格当成普遍能力。
- 把音频、元素、结束帧和参考素材视为按模型提供的可选能力,而不是所有图生视频任务的默认功能。
图生视频适合哪些场景
当项目已经有确定的主体或开场画面时,图生视频最有价值。它可以为照片、插画、商品图、概念图或设计稿加入动作、环境变化和镜头运动。更现实的目标,是先把静态画面变成一段目标明确的动态片段,而不是用一次生成替代全部剪辑和动画制作。
- 人像微动作:加入轻微表情、视线变化、呼吸、发丝运动或缓慢推镜,同时尽量保持人物识别特征。
- 商品动画:商品保持中心,加入光线扫过、轻微环绕、雾气、粒子、反射或背景揭示。
- 插画与概念图:让天气、布料、植物、发光效果、空间层次或角色产生适度运动。
- 建筑与室内:加入移动光影、远处人物、窗帘、交通、水面或缓慢镜头运动。
- 社交静态视觉转动态:把活动主视觉变成短片钩子,并按当前模型支持情况测试横竖构图。
- 分镜和提案:在正式制作前展示镜头速度与运动方向,帮助团队理解意图。
如何保持主体和构图稳定
一致性取决于源图、动作幅度、镜头变化、模型和时长之间的平衡。视角越偏离原图,模型越需要创造看不见的几何结构,人物脸部、手部、Logo、商品细节和背景就越容易变化。
先用最小动作证明思路,再一次只增加一个维度:动作幅度、镜头距离、环境变化或时长。这样能建立稳定基线,也更容易定位失败原因。
人物或角色身份漂移
换用更清楚的源图,减少大幅转头和极端环绕镜头,并写明最需要保持的人物或商品特征。不要同时改变服装、年龄、光线和视角。
手部、边缘或商品几何变形
选择边界清楚、遮挡更少的图片,降低快速肢体动作和强透视变化。商品提示词中明确保持轮廓和标签区域。
背景被替换或出现多余物体
说明背景保持稳定,删除宽泛的变形或重构词。固定或轻微镜头能减少模型创造画外空间的压力。
动作不符合原始姿势
让动作从源图可见姿势自然开始。坐姿人物可以先转头、前倾或伸手,再尝试需要完整身体和地面空间的大动作。
结束帧过渡突然
在当前模型支持结束帧时,缩小两张图在镜头角度、主体大小、场景布局和光线上的差异,并写清连接它们的一条主要变化。
继续完成视觉工作流
- 改用文字描述场景当你希望模型从提示词重新创造开场画面时,进入文生视频。
- 比较全部 AI 视频模式返回 AI 视频生成器总入口,直接比较文字和图片两种方式。
- 先生成或优化源图当人物、插画、商品图或场景构图还不够合适时,先使用 AI 生图工具。
- 查看全部 Genify 创作模式返回首页,比较文字和图片生成图片与视频的四种现有方式。