Gemini 3 + Veo 3:普通人周末做出一条“城市攻略视频”,到底有多远?
Gemini 3 + Veo 3:普通人周末做出一条“城市攻略视频”,到底有多远?
周六下午 4 点,我给自己定了一个很普通、也很苛刻的目标:不用先打开剪辑软件,只靠一段对话,把一条能发抖音 / 小红书的周末城市攻略做出来。
不是发布会演示那种“未来感样片”,也不是把一堆参数念一遍。我要的是更接地气的结果:30~60 秒、能看懂、能发出去、至少像那么回事。
如果你也有过这种痛点——想做内容,但一想到找资料、写脚本、拆镜头、配画面就想关掉页面——那这次实验,基本就是替你做的。
先说结论:Gemini 3 把“搜索取证 → 攻略脚本 → 分镜提示词 → Veo 3 成片”串起来后,普通人确实能在一个周末把想法推到可发视频。
但它不是“一口气全包”。更准确地说,一口气能覆盖中腰部流程:选题、事实核实、脚本、分镜、初版成片;真正决定质量的,还是你会不会拆镜头、会不会卡节奏、会不会把模型编造的东西拎出来改掉。
---
先把问题钉死:什么叫“一口气从脚本到视频”
我这次定义的成功标准很朴素:
- 一条 30~60 秒 的周末城市攻略
- 适合发 抖音 / 小红书
- 有 封面文案、口播/字幕、3~6 个实景镜头、结尾行动号召
- 第一次成片不另开剪辑软件
- 城市选一个大多数国内读者都能立刻代入的地方:杭州
为什么是杭州?因为它足够“熟”:西湖、地铁、商圈、夜景、咖啡馆、步行街,内容素材好找,踩雷点也典型。更重要的是,杭州这种城市最适合验证一件事:AI 到底是在帮你省时间,还是只是在让你更快地把错误写出来。
这篇不是新闻稿。
我只回答三个问题:能不能做、卡在哪、普通人怎么抄。
---
全流程实操:同一条对话里跑通“搜 → 写 → 拆镜 → 出片”
1)先搜索,不要先写
我先让 Gemini 3 做的不是“写文案”,而是搜证据。
提示词很简单:
请帮我做一条“杭州周末攻略”短视频,先不要写脚本。先搜索并整理以下信息:
1. 适合周末半天/一天的地点
2. 交通方式(地铁/步行)
3. 营业时间或开放时间
4. 可能踩雷的点
5. 适合拍视频的场景
要求:给出来源信息,并区分“可确认事实”和“建议”
Gemini 的好处在于,它不是只吐一个“推荐清单”,而是会把资料拆成几类:
- 可确认的营业/开放时间
- 地铁站和步行路线
- 适合拍的镜头点位
- 一些可能的注意事项
但这里也最容易出错:模型会把“建议”写成“事实”,把“看起来像”说成“就是”。
比如它曾经把某个店的营业时间说得很完整,语气也很像真的,但我回头一查来源,发现那句话其实是它根据页面片段“补全”出来的,不够严谨。
我改掉的方法也很简单:凡是要进旁白的句子,必须能在搜索来源里找到对应证据。
改完之后,旁白不再追求“全”,只追求“稳”。
2)把资料压成 150~250 字脚本
第二步不是写长文,而是压成短口播。
我给它的要求是:
把上面的搜索结果压缩成一段 150~250 字的短视频口播脚本。
风格:像一个周末真去过的人在分享,不像景区宣传片。
要求:
- 开头 3 秒直接给结论
- 中间只保留 3 个重点
- 结尾给一个行动号召
- 不要夸张,不要空话
- 所有事实必须来自上一步搜索内容
终版脚本我后来定成这样:
周末去杭州,如果你只想花半天把“城市感”拍出来,我建议直接从西湖边开始。
上午先坐地铁到龙翔桥或凤起路一带,顺着湖边慢慢走,先拍开阔的水面和人流,再去附近找一两家咖啡店或小店补细节。
中午别赶太多点,留时间给步行和吃饭;傍晚再回到湖边看光线变化,城市的松弛感会比白天更明显。
这条路线最适合第一次来杭州的人:不累、好拍、也容易出片。
如果你想要,我下一条直接给你做一版“半天拍完的杭州分镜清单”。
这段话的价值不在文采,而在于它已经具备了短视频的骨架:一句钩子、三个重点、一个收尾。
3)把脚本拆成分镜,不要让模型自由发挥
这一步最关键,也最容易被忽略。
很多人以为“写好脚本”就等于“视频能做”。其实不是,脚本只是文章,分镜才是执行。
我让 Gemini 3 继续做拆解,要求它输出 6 镜左右,并且每一镜都写清楚:
- 镜号
- 秒数
- 画面提示词
- 旁白
- 是否采用
提示词如下:
把上面的口播脚本拆成 6 个 Veo 3 镜头。
每个镜头需要包含:
- 镜号
- 时长(4~7 秒)
- 景别
- 运镜
- 画面内容
- 旁白对应句
- 是否适合直接用于生成
要求:
- 画面尽量真实
- 不要出现可识别真人脸
- 不要生成屏幕字幕,字幕留给后期
- 地标必须准确
我最后保留的分镜表大致是这样:
| 镜号 | 秒数 | 画面提示词 | 旁白 | 是否采用 | |---|---:|---|---|---| | 1 | 5s | 清晨西湖远景,湖面平静,轻微推镜 | 周末去杭州,如果你只想花半天把城市感拍出来…… | 是 | | 2 | 6s | 地铁出站后的人流与街景,手持轻微跟拍 | 上午先坐地铁到龙翔桥或凤起路一带…… | 是 | | 3 | 5s | 湖边步行,树影与路人掠过 | 顺着湖边慢慢走,先拍开阔的水面和人流…… | 是 | | 4 | 6s | 咖啡店门口、桌面、手部特写 | 再去附近找一两家咖啡店或小店补细节…… | 是 | | 5 | 6s | 傍晚逆光湖边,城市轮廓渐暗 | 傍晚再回到湖边看光线变化…… | 是 | | 6 | 5s | 结尾空镜 + 字幕位 | 这条路线最适合第一次来杭州的人…… | 是 |这里最重要的人工修改只有一句:
地名必须二次确认。像“龙翔桥 / 凤起路”这种点位,模型有时会混淆站名和周边地名。你不改,后面整个视频的可信度都会掉。
4)开始出片:先看泛提示,再看锁死参数
接下来我分别试了两种提示方式。
#### 泛提示版
杭州西湖,城市周末攻略,清晨,真实感,电影感,轻微运镜,适合短视频
结果很典型:
画面“像杭州”,但不够像你想去的杭州。问题主要在三处:
- 地标存在感不稳定
- 运镜容易太飘
- 细节会被模型自由脑补
#### 锁景别版
Wide shot of West Lake in Hangzhou at early morning, calm water, soft natural light, slow push-in camera movement, documentary style, realistic street atmosphere, no subtitles, no visible logos, no close-up of faces, vertical 9:16
这一版就明显稳很多。
不是说它“绝对正确”,而是它开始满足短视频可用的最低标准:镜头关系清楚、气氛一致、可继续往后剪。
我还做了中英双版本。经验很直接:中文能让你更快想清楚意思,英文更容易把镜头约束写实。
所以我建议是:先中文理顺,再用英文锁画面。
---
对照片:传统周末攻略 vs 这条流水线,到底省了什么
先说结论:它省的是启动成本,不是判断成本。
| 环节 | 传统做法 | Gemini 3 + Veo 3 流水线 | | 资料搜集 | 打开多个网页、收藏夹、备忘录 | 一轮搜索直接拉事实 | | 脚本 | 空白文档里憋半天 | 先压成口播骨架 | | 分镜 | 口头想象,容易漏 | 对话里直接拆镜头 | | 出片 | 找素材、拼素材、反复试 | 直接生成草稿 | | 修改 | 依赖剪辑经验 | 在对话里先筛掉废镜头 |但它没省掉的也很明确:
- 选题判断:你得知道这条内容是不是值得拍
- 事实核实:搜索结果不能无脑照抄
- 品牌调性:你想要“精致周末感”还是“本地人逛街感”,必须自己定
- 镜头取舍:Veo 3 不是你说什么它就懂什么
我这次最明显的翻车镜头有三个:
1. 招牌乱码
这是 AI 视频的老问题:远景还行,一到店招、文字、路牌,容易变形。
2. 季节错位
我明明写的是“周末清晨”,它有时会给出过于“春意盎然”的画面,和现实光线不完全一致。
3. 地标“像但不对”
最麻烦。它能生成一个很像西湖的湖景,但你一眼能感觉到“不是那个味儿”。
所以这次实验最真实的结论不是“AI 已经能自动做视频了”,而是:
AI 已经把 70% 的准备工作压缩掉了,但最后 30% 的判断,还是人来做。---
给小白到进阶的可复制工作流
小白版:一条总控提示词 + 固定 6 镜公式
你可以直接这么起步:
请帮我做一条【城市周末攻略】短视频,城市是【杭州】。
目标:30~60 秒,适合抖音/小红书。
流程:
1. 先搜索真实信息,整理营业时间、交通、踩雷点
2. 再写 150~250 字口播稿
3. 再拆成 6 个镜头
4. 最后给每个镜头写 Veo 3 提示词
约束:
- 不要虚构事实
- 不要生成字幕
- 不要出现可识别真人脸
- 所有地名和时间必须可核实
固定 6 镜公式也很好用:
1. 空镜建立
2. 街道氛围
3. 店内细节
4. 食物特写
5. 夜景过渡
6. 结尾字幕位
这个公式的优点是:不会乱,且足够短视频化。
进阶版:让信息可追溯,镜头可控
如果你已经会一点内容制作,可以加三条规则:
- 搜索引用必须带出处再写进旁白
- 镜头提示词里锁死“无字幕画面 + 后期烧字幕”
- 同一分镜生成 2 条,选更稳的那条
再补一个非常实用的节奏规则:
每个镜头控制在 4~7 秒。太短,信息乱;太长,短视频感没了。
不要让模型自由发挥的负面清单
这部分很重要,能少踩很多坑:
- 不要让它虚构探店
- 不要让它编营业时间
- 不要让它生成可识别真人脸当本地达人
- 不要让它随便替你补招牌文字
- 不要让它把“建议”写成“事实”
做视频最怕的不是 AI 不够聪明,
而是它太愿意帮你“补完世界”。
---
如果你想批量做,这套能力可以直接接 API
手工对话适合周末做 1 条。
但如果你想把它变成循环任务,比如:
- 同一城市做 8 个片区
- 每周更新一次周末攻略
- 给不同平台生成不同版本
那就不该停留在“聊天式手搓”了。你需要把它变成可复用的提示词模板 + API 工作流。
上面的提示词骨架我已经按对话写出来了;如果你要接到自己的脚本或定时任务里,同一套能力也可以走 API。
你可以直接去看 api.884819.xyz,注册流程很简单:用户名+密码即可注册,不需要邮箱验证,而且新用户注册即送体验token。
国产模型(Deepseek/千问等)完全免费,没有月租、没有订阅,按量付费,注册后还能直接用内置 AI 对话功能。
---
结论:能一口气做完,但不能一口气做好到“无需修改就能发”
我的判断很明确:
- 信息核实、脚本、分镜,可以有 80% 留在 Gemini 里完成
- 成片,已经足够做成“可内部分享 / 可当草稿”的水平
- 但要上平台,还是建议你再花 10~20 分钟 做最后处理:
所以别把这套流程想成“AI 替你拍视频”。
更像是:AI 帮你把从 0 到 1 的路铺平了,但 1 到 10 还是得你自己踩。
今晚你最值得做的,不是幻想“一条龙无人值守”,而是直接跑一个最小实验:
拿你自己的城市,做 3 个镜头,先验证能不能把一条草稿推出来。下一篇,我会继续做这条实验的“下一公里”:把同一条周末城市攻略接到字幕烧录、BGM 卡点和封面三件套,并对比继续留在 Gemini 对话里修,和导出到剪映 / CapCut 各要多久。
专门写给那些已经能出片,却还卡在“发出去没人看”的人。
本文由8848AI原创,转载请注明出处。关注8848AI,带你从零开始学AI。#AI教程 #Gemini #Veo3 #短视频制作 #Prompt技巧 #8848AI #AI学习 #内容创作