Veo 3.1: Google 视频生成模型迎来重大升级

Veo 3.1: Google 视频生成模型迎来重大升级

Olivia Hughes
185
original

Google DeepMind 发布 Veo 3.1,大幅提升视频生成的一致性、创造力和控制力。新模型支持竖屏视频,并对镜头运动、角色表情等细节有了更精准的操控,为内容创作者带来专业级工具。

视频生成领域又迎来一次重要更新。Google DeepMind 今天正式推出 Veo 3.1,这是其视频生成模型的第三个主要版本。相比前代,这次升级的重点非常明确:让生成的视频更连贯、更富有创意,同时给用户更强的控制权。

如果你曾尝试过AI视频生成,大概会对“闪烁”和“变形”头痛不已——角色脸部在帧间突变,背景物体莫名消失。Veo 3.1 试图解决这些核心痛点。根据官方演示,新模型在 帧间一致性 上有了质的飞跃,角色和场景元素能够稳定保持,视频看起来更像实拍而非一堆飘忽不定的像素。

竖屏视频与社交媒体的崛起

一个值得注意的变化是,Veo 3.1 终于原生支持 竖屏视频生成。这背后显然是 TikTok、Instagram Reels、YouTube Shorts 等短格式视频平台的推波助澜。过去,视频生成模型大多默认输出横屏宽高比,创作者不得不手动裁剪或重新构图,往往损失重要内容。现在,从提示词到输出,竖屏生成一气呵成,大大缩短了内容生产链路。

对普通创作者来说,这意味着你直接用文字描述一个“咖啡馆窗边的手冲咖啡特写,竖屏,电影感灯光”,Veo 3.1 就能输出一条可直接发布的竖屏短片,无需后期二次处理。

更细颗粒度的控制

除了一致性和格式,Veo 3.1 在可控性上也下了功夫。用户现在可以通过参数微调 镜头运动(推拉摇移)角色微表情 以及 光照变化。举个例子,如果你希望镜头从人物面部缓慢拉远到全景,并且光线从清晨转为黄昏,Veo 3.1 可以在单次生成中实现这种复杂的动态变化。

Google 还强调,团队在训练数据中进行了更严格的 负样本筛选,以减少有害内容和偏见。这在商业应用中尤为重要——品牌不希望自己的广告视频出现不可控的奇怪画面。

实际影响:谁需要 Veo 3.1?

  • 社交媒体内容创作者:竖屏支持 + 高一致性,意味着你可以在几分钟内生成一个产品演示或Vlog片段,无需拍摄团队。
  • 广告与营销人员:精准的镜头控制和场景一致性,适合制作原型视频或A/B测试创意方案。
  • 独立电影人:快速可视化分镜头脚本,探索不同运镜和色调的可行性。

当然,Veo 3.1 目前仍处于早期访问阶段,并非人人可用。Google 通过 Vertex AI 平台提供 API 调用,这意味着它更偏向于专业用户和开发者。对于普通用户,或许还需要等待集成到更亲民的产品中。

竞争格局与展望

视频生成赛道已经非常拥挤:OpenAI 的 Sora、Runway Gen-3、Pika 2.0 都是强劲对手。Veo 3.1 的优势在于 Google 的生态——与 Gemini 模型 的潜在整合、YouTube 的数据积累,以及强劲的 TPU 算力。不过,Sora 尚未公开可用,Runway 和 Pika 则早已开放给创作者。Veo 3.1 能否后来居上,还要看其开放速度和定价策略。

从技术角度看,Google 这次在 一致性 上下的功夫值得关注。如果实际效果与宣传相符,它可能会成为第一个让“AI视频不闪烁”的可用方案。对任何靠视频吃饭的人来说,这都值得关注。

总的来说,Veo 3.1 不是一次颠覆性的创新,而是一次扎实的迭代——它在最关键的问题上做出了改进,并且精准地切入了当前最热门的竖屏内容需求。如果你是视频创作者,并且能接触到 Vertex AI,现在就应该去申请试用。市场变化很快,下一个爆款视频或许就诞生于你的键盘。

Veo3.1Google DeepMindAI视频生成竖屏视频视频一致性视频控制社交媒体内容Vertex AI

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

相似工具

Dreamina

Dreamina

Dreamina 是一款集生成图像、动画视频与创意视觉设计于一体的在线创作平台,由 CapCut 团队支持。与传统的图像或视频制作软件不同,Dreamina 通过简单的文字提示或上传素材,让用户在浏览器中快速生成符合设想的视觉作品。它能从文字描述衍生图像、将静态图转为动态视频,甚至结合 AI 声音与动画效果,为视觉创作者和内容生产者提供便捷的创作入口。

Vheer

Vheer

Vheer 是一个在线的 AI 图像 / 设计工具平台,提供文字转图像(Text-to-Image)、图像转图像(Image-to-Image)、视频生成、头像/动漫/纹身图案生成、背景移除等功能。

ImagineArt

ImagineArt

ImagineArt(域名 imagine.art)是一个以生成式 AI 为核心的创意工具套件 / 平台,主要用于生成与编辑图像、视频等视觉内容。官网称可以 “创造人工智能艺术,将你的想象变成现实”

Lovart

Lovart

Lovart将创意需求自动化为设计成果,把复杂的创作流程简化为“说一句话,出一个作品”。其多模型融合、无限画布和可编辑输出等特点,让用户在单一平台上完成从构思到落地的整个创作过程,是一款集AI绘画、图片生成、文生图、视频制作、品牌设计于一体的综合性创作工具。

Symphony Creative Studio

Symphony Creative Studio

Symphony Creative Studio 是 TikTok 推出的一款AI 驱动的创意视频工具,旨在帮助广告主和内容创作者快速生成符合 TikTok 平台风格的原创短视频。

通义万相

通义万相

通义万相 是阿里云 / 通义体系下针对视觉创作(图像 / 视频)的 AI 生成工具 / 模型。用户通过输入文字提示 or 上传图像,可以生成富有风格、创意的图像或短视频。它具备多模态能力(文字 ↔ 图像 ↔ 视频)并提供给开发者 API 接口,可以被整合进其他产品与服务。它的发展正在从图像生成扩展到视频生成、音画同步、配音等。

开源项目

palmier-pro: macOS 上专为 AI 打造的视频编辑器

palmier-pro 是一个开源的 macOS 视频编辑器,专为 AI 工作流设计。它利用本地 AI 模型实现智能剪辑、场景检测和自动字幕生成,让视频编辑更高效。适合独立创作者和开发者自定义。

ArcReel: 开源AI视频工作台,小说转视频

ArcReel 是一个基于 AI Agent 的开源视频生成工作台,能将小说自动转化为角色、场景、道具,再生成剧本、分镜图并最终合成视频。它通过跨镜头角色与场景一致性技术,确保叙事连贯,支持 Veo 3.1、Grok、Seedance 等模型,适合内容创作者和开发者。

MoneyPrinterTurbo: 短视频自动生成流水线

主要用于自动生成短视频,将文案生成、配音、画面素材拼接、视频输出几件事串起来。更接近一种“流水线式内容生成工具”

waoowaoo: 工业级AI影视生产全流程平台

waoowaoo 是首个工业级开源 AI 影视生产平台,专注于可控影视制作,支持从短视频到长篇电影的好莱坞标准工作流,基于 TypeScript 构建,提供 AI Agent 驱动的全流程创作能力。

Wan2.2: 文本图像转视频AI框架

它是一个用于 视频生成 / 视频合成 / 文本 / 图像 → 视频 的 AI 模型库 / 框架,支持多种任务(Text → Video、Image → Video、Text+Image → Video 等)

Jaaz: 开源创意工具,本地灵活创作图像视频设计

Jaaz 是一个面向创意 /图像 /视频 /布局设计 /多模态内容的开源工具 /平台 /框架,目标是让用户在本地 /混合环境中,用更灵活、可控的方式进行创作(图像 + 视频 + 画布设计 + prompt 自动优化等)