GeekLink
本地桌面应用,用于 OCR 字幕提取、语音转写和字幕翻译
访问官网参考视频是一种基于网络的AI视频生成工作流,使用一个或多个源素材作为创作依据。它不要求文本提示同时记住人脸、产品、服装、动作、相机风格和声音,而是让每个参考定义新合成镜头的特定部分。源素材可以包括用于身份、产品、服装或风格的图像;用于动作和相机行为的视频;以及用于语音、音乐和时机的音频。
出色的结果不是逐帧复制源素材,而是在保留创造连续性的细节的同时,允许场景、动作、取景和故事节奏发生变化。该页面将此工具定位为面向剧集创作者、AI网红、产品宣传、动漫角色、时尚序列、音乐视频和品牌世界。与纯提示生成的区别被描述为控制:参考在整个镜头中保持活跃,定义哪些必须保持可识别,哪些可以改变。
项目从清晰的图像开始,用于身份、产品、服装或风格。当短片段和音频参考有助于动作、相机、语音或时机时,添加它们。
提示告诉模型@Image1、@Video1和@Audio1控制什么,然后描述动作、场景、相机以及不能更改的细节。
检查结果中的人脸、服装、产品几何形状、角色、动作和音频时机。页面建议一次只更改一个指令。
身份参考旨在使面部、头发、身体比例和显著特征在新场景中保持可识别。
产品参考用于在新镜头中保持形状、颜色、材质、包装和标签位置。
短片段视频参考可以指导手势、时机、身体动作和表演能量。
参考片段可以承载难以用文字描述的平移、环绕、推拉或手持移动。
源素材可以将位置、灯光语言、调色板或视觉世界带入新合成的镜头。
在接受音频参考的模型上,音频可以指导对话、语音、音乐、节拍和动作时机。
合成器支持Seedance 2.0 Mini、2.0 Fast和2.5、MiniMax H3以及Gemini Omni Flash 1.1。Seedance 2.0和MiniMax H3最多接受九张图像、三个视频和三个音频文件;Seedance 2.5最多接受30张图像、10个视频和10个音频文件;Omni Flash 1.1使用七个加权参考槽,其中一个视频占用两个槽,且只允许一个视频。合成器会验证当前的限制。
一个身份参考旨在将相同的面部、发型、服装和比例贯穿地点和相机角度的变化。
单独的角色参考加上场景参考用于在互动中保持面部、服装和角色独特性。
一个创作者和一个产品可以在不同场景之间移动,例如卧室评测和浴室演示,而无需改变人物或重新设计包装。
全身参考可以在生成的场景中保持服装、材质、颜色和配饰固定。
清晰展示几何形状、品牌、颜色和材质的产品参考可以在创作者、环境、动作或相机变化时重复使用。
页面列出了动漫/原创角色、吉祥物和游戏角色以及音乐视频表演者作为连续性工作流。
它从一个或多个源素材生成新视频。图像可以定义人物、产品、服装、场景或风格;视频可以指导动作和相机行为;音频可以指导语音、音乐和时机。提示为每个参考分配任务。
清晰的 身份图像为模型提供稳定的面部结构、头发、比例和独特细节的证据。额外的参考可以定义服装或另一个角度。当提示只命名角色一次并避免冲突的肖像时,一致性会提高。
图像到视频通常将一个静态图像动画化,并将其视为开场帧。参考视频可以组合多个图像、视频和音频文件,在新合成的镜头中持续指导身份、产品、动作、相机、风格或时机。
可以。支持的模型可以同时接受图像、视频和音频参考。图像用于身份或外观,短片段视频用于动作或相机方向,音频用于对话、语音、节拍或节奏。
清晰图像,主体足够大以便检查,中性光线,遮挡最少。对于角色,建议正面或四分之三视图;对于产品,包括标签、形状、材质和一个有用的备用角度。
可以,但每个角色应有单独的图像参考和稳定的名称。建议将每个动作、服装和位置映射到正确的角色,以减少面部替换、服装交叉和角色混淆。
可以。产品参考应清晰展示几何形状、品牌、颜色和材质,而创作者、环境、动作或相机在每次生成中变化。应仔细检查标签位置和比例。
限制因模型而异。Seedance 2.0和MiniMax H3最多接受九张图像、三个视频和三个音频文件;Seedance 2.5最多接受30张图像、10个视频和10个音频文件;Omni Flash 1.1使用七个加权参考槽,其中一个视频占用两个槽,且只允许一个视频。合成器会验证当前的限制。
当素材冲突、主体太小或提示从未解释素材的角色时,参考通常会被忽略。页面建议删除冗余文件,裁剪相关细节,使用明确的@Image、@Video或@Audio标记,并一次测试一个更改。