Gemini 3 + Veo 3:普通人周末做出一条“城市攻略视频”,到底有多远?

周六下午 4 点,我给自己定了一个很普通、也很苛刻的目标:不用先打开剪辑软件,只靠一段对话,把一条能发抖音 / 小红书的周末城市攻略做出来。

不是发布会演示那种“未来感样片”,也不是把一堆参数念一遍。我要的是更接地气的结果:30~60 秒、能看懂、能发出去、至少像那么回事

如果你也有过这种痛点——想做内容,但一想到找资料、写脚本、拆镜头、配画面就想关掉页面——那这次实验,基本就是替你做的。

先说结论:Gemini 3 把“搜索取证 → 攻略脚本 → 分镜提示词 → Veo 3 成片”串起来后,普通人确实能在一个周末把想法推到可发视频。

但它不是“一口气全包”。更准确地说,一口气能覆盖中腰部流程:选题、事实核实、脚本、分镜、初版成片;真正决定质量的,还是你会不会拆镜头、会不会卡节奏、会不会把模型编造的东西拎出来改掉。

---

先把问题钉死:什么叫“一口气从脚本到视频”

我这次定义的成功标准很朴素:

  • 一条 30~60 秒 的周末城市攻略
  • 适合发 抖音 / 小红书
  • 封面文案、口播/字幕、3~6 个实景镜头、结尾行动号召
  • 第一次成片不另开剪辑软件
  • 城市选一个大多数国内读者都能立刻代入的地方:杭州

为什么是杭州?因为它足够“熟”:西湖、地铁、商圈、夜景、咖啡馆、步行街,内容素材好找,踩雷点也典型。更重要的是,杭州这种城市最适合验证一件事:AI 到底是在帮你省时间,还是只是在让你更快地把错误写出来。

这篇不是新闻稿。
我只回答三个问题:能不能做、卡在哪、普通人怎么抄。

---

全流程实操:同一条对话里跑通“搜 → 写 → 拆镜 → 出片”

1)先搜索,不要先写

我先让 Gemini 3 做的不是“写文案”,而是搜证据

提示词很简单:

请帮我做一条“杭州周末攻略”短视频,先不要写脚本。先搜索并整理以下信息:

1. 适合周末半天/一天的地点

2. 交通方式(地铁/步行)

3. 营业时间或开放时间

4. 可能踩雷的点

5. 适合拍视频的场景

要求:给出来源信息,并区分“可确认事实”和“建议”

Gemini 的好处在于,它不是只吐一个“推荐清单”,而是会把资料拆成几类:

  • 可确认的营业/开放时间
  • 地铁站和步行路线
  • 适合拍的镜头点位
  • 一些可能的注意事项

但这里也最容易出错:模型会把“建议”写成“事实”,把“看起来像”说成“就是”。

比如它曾经把某个店的营业时间说得很完整,语气也很像真的,但我回头一查来源,发现那句话其实是它根据页面片段“补全”出来的,不够严谨。

我改掉的方法也很简单:凡是要进旁白的句子,必须能在搜索来源里找到对应证据。

改完之后,旁白不再追求“全”,只追求“稳”。

2)把资料压成 150~250 字脚本

第二步不是写长文,而是压成短口播。

我给它的要求是:

把上面的搜索结果压缩成一段 150~250 字的短视频口播脚本。

风格:像一个周末真去过的人在分享,不像景区宣传片。

要求:

  • 开头 3 秒直接给结论
  • 中间只保留 3 个重点
  • 结尾给一个行动号召
  • 不要夸张,不要空话
  • 所有事实必须来自上一步搜索内容

终版脚本我后来定成这样:

周末去杭州,如果你只想花半天把“城市感”拍出来,我建议直接从西湖边开始。

上午先坐地铁到龙翔桥或凤起路一带,顺着湖边慢慢走,先拍开阔的水面和人流,再去附近找一两家咖啡店或小店补细节。

中午别赶太多点,留时间给步行和吃饭;傍晚再回到湖边看光线变化,城市的松弛感会比白天更明显。

这条路线最适合第一次来杭州的人:不累、好拍、也容易出片。

如果你想要,我下一条直接给你做一版“半天拍完的杭州分镜清单”。

这段话的价值不在文采,而在于它已经具备了短视频的骨架:一句钩子、三个重点、一个收尾。

3)把脚本拆成分镜,不要让模型自由发挥

这一步最关键,也最容易被忽略。

很多人以为“写好脚本”就等于“视频能做”。其实不是,脚本只是文章,分镜才是执行。

我让 Gemini 3 继续做拆解,要求它输出 6 镜左右,并且每一镜都写清楚:

  • 镜号
  • 秒数
  • 画面提示词
  • 旁白
  • 是否采用

提示词如下:

把上面的口播脚本拆成 6 个 Veo 3 镜头。

每个镜头需要包含:

  • 镜号
  • 时长(4~7 秒)
  • 景别
  • 运镜
  • 画面内容
  • 旁白对应句
  • 是否适合直接用于生成
要求:
  • 画面尽量真实
  • 不要出现可识别真人脸
  • 不要生成屏幕字幕,字幕留给后期
  • 地标必须准确

我最后保留的分镜表大致是这样:

| 镜号 | 秒数 | 画面提示词 | 旁白 | 是否采用 | |---|---:|---|---|---| | 1 | 5s | 清晨西湖远景,湖面平静,轻微推镜 | 周末去杭州,如果你只想花半天把城市感拍出来…… | 是 | | 2 | 6s | 地铁出站后的人流与街景,手持轻微跟拍 | 上午先坐地铁到龙翔桥或凤起路一带…… | 是 | | 3 | 5s | 湖边步行,树影与路人掠过 | 顺着湖边慢慢走,先拍开阔的水面和人流…… | 是 | | 4 | 6s | 咖啡店门口、桌面、手部特写 | 再去附近找一两家咖啡店或小店补细节…… | 是 | | 5 | 6s | 傍晚逆光湖边,城市轮廓渐暗 | 傍晚再回到湖边看光线变化…… | 是 | | 6 | 5s | 结尾空镜 + 字幕位 | 这条路线最适合第一次来杭州的人…… | 是 |

这里最重要的人工修改只有一句:

地名必须二次确认。

像“龙翔桥 / 凤起路”这种点位,模型有时会混淆站名和周边地名。你不改,后面整个视频的可信度都会掉。

4)开始出片:先看泛提示,再看锁死参数

接下来我分别试了两种提示方式。

#### 泛提示版

杭州西湖,城市周末攻略,清晨,真实感,电影感,轻微运镜,适合短视频

结果很典型:

画面“像杭州”,但不够像你想去的杭州。问题主要在三处:

  • 地标存在感不稳定
  • 运镜容易太飘
  • 细节会被模型自由脑补

#### 锁景别版

Wide shot of West Lake in Hangzhou at early morning, calm water, soft natural light, slow push-in camera movement, documentary style, realistic street atmosphere, no subtitles, no visible logos, no close-up of faces, vertical 9:16

这一版就明显稳很多。

不是说它“绝对正确”,而是它开始满足短视频可用的最低标准:镜头关系清楚、气氛一致、可继续往后剪。

我还做了中英双版本。经验很直接:中文能让你更快想清楚意思,英文更容易把镜头约束写实。

所以我建议是:先中文理顺,再用英文锁画面。

---

对照片:传统周末攻略 vs 这条流水线,到底省了什么

先说结论:它省的是启动成本,不是判断成本。

| 环节 | 传统做法 | Gemini 3 + Veo 3 流水线 | | 资料搜集 | 打开多个网页、收藏夹、备忘录 | 一轮搜索直接拉事实 | | 脚本 | 空白文档里憋半天 | 先压成口播骨架 | | 分镜 | 口头想象,容易漏 | 对话里直接拆镜头 | | 出片 | 找素材、拼素材、反复试 | 直接生成草稿 | | 修改 | 依赖剪辑经验 | 在对话里先筛掉废镜头 |

但它没省掉的也很明确:

  • 选题判断:你得知道这条内容是不是值得拍
  • 事实核实:搜索结果不能无脑照抄
  • 品牌调性:你想要“精致周末感”还是“本地人逛街感”,必须自己定
  • 镜头取舍:Veo 3 不是你说什么它就懂什么

我这次最明显的翻车镜头有三个:

1. 招牌乱码

这是 AI 视频的老问题:远景还行,一到店招、文字、路牌,容易变形。

2. 季节错位

我明明写的是“周末清晨”,它有时会给出过于“春意盎然”的画面,和现实光线不完全一致。

3. 地标“像但不对”

最麻烦。它能生成一个很像西湖的湖景,但你一眼能感觉到“不是那个味儿”。

所以这次实验最真实的结论不是“AI 已经能自动做视频了”,而是:

AI 已经把 70% 的准备工作压缩掉了,但最后 30% 的判断,还是人来做。

---

给小白到进阶的可复制工作流

小白版:一条总控提示词 + 固定 6 镜公式

你可以直接这么起步:

请帮我做一条【城市周末攻略】短视频,城市是【杭州】。

目标:30~60 秒,适合抖音/小红书。

流程:

1. 先搜索真实信息,整理营业时间、交通、踩雷点

2. 再写 150~250 字口播稿

3. 再拆成 6 个镜头

4. 最后给每个镜头写 Veo 3 提示词

约束:

  • 不要虚构事实
  • 不要生成字幕
  • 不要出现可识别真人脸
  • 所有地名和时间必须可核实

固定 6 镜公式也很好用:

1. 空镜建立

2. 街道氛围

3. 店内细节

4. 食物特写

5. 夜景过渡

6. 结尾字幕位

这个公式的优点是:不会乱,且足够短视频化。

进阶版:让信息可追溯,镜头可控

如果你已经会一点内容制作,可以加三条规则:

  • 搜索引用必须带出处再写进旁白
  • 镜头提示词里锁死“无字幕画面 + 后期烧字幕”
  • 同一分镜生成 2 条,选更稳的那条

再补一个非常实用的节奏规则:

每个镜头控制在 4~7 秒。

太短,信息乱;太长,短视频感没了。

不要让模型自由发挥的负面清单

这部分很重要,能少踩很多坑:

  • 不要让它虚构探店
  • 不要让它编营业时间
  • 不要让它生成可识别真人脸当本地达人
  • 不要让它随便替你补招牌文字
  • 不要让它把“建议”写成“事实”
做视频最怕的不是 AI 不够聪明,
而是它太愿意帮你“补完世界”。

---

如果你想批量做,这套能力可以直接接 API

手工对话适合周末做 1 条。

但如果你想把它变成循环任务,比如:

  • 同一城市做 8 个片区
  • 每周更新一次周末攻略
  • 给不同平台生成不同版本

那就不该停留在“聊天式手搓”了。你需要把它变成可复用的提示词模板 + API 工作流

上面的提示词骨架我已经按对话写出来了;如果你要接到自己的脚本或定时任务里,同一套能力也可以走 API。

你可以直接去看 api.884819.xyz,注册流程很简单:用户名+密码即可注册,不需要邮箱验证,而且新用户注册即送体验token。

国产模型(Deepseek/千问等)完全免费,没有月租、没有订阅,按量付费,注册后还能直接用内置 AI 对话功能。

---

结论:能一口气做完,但不能一口气做好到“无需修改就能发”

我的判断很明确:

  • 信息核实、脚本、分镜,可以有 80% 留在 Gemini 里完成
  • 成片,已经足够做成“可内部分享 / 可当草稿”的水平
  • 但要上平台,还是建议你再花 10~20 分钟 做最后处理:
换 BGM、烧字幕、切掉崩坏帧、补一张真实封面

所以别把这套流程想成“AI 替你拍视频”。

更像是:AI 帮你把从 0 到 1 的路铺平了,但 1 到 10 还是得你自己踩。

今晚你最值得做的,不是幻想“一条龙无人值守”,而是直接跑一个最小实验:

拿你自己的城市,做 3 个镜头,先验证能不能把一条草稿推出来。

下一篇,我会继续做这条实验的“下一公里”:把同一条周末城市攻略接到字幕烧录、BGM 卡点和封面三件套,并对比继续留在 Gemini 对话里修,和导出到剪映 / CapCut 各要多久。

专门写给那些已经能出片,却还卡在“发出去没人看”的人。

本文由8848AI原创,转载请注明出处。关注8848AI,带你从零开始学AI。

#AI教程 #Gemini #Veo3 #短视频制作 #Prompt技巧 #8848AI #AI学习 #内容创作