我先把文章骨架压成可直接发布的版本,再补上工作流、对比示例和可复用模板。
我先把文章骨架压成可直接发布的版本,再补上工作流、对比示例和可复用模板。重点会放在“先拆脚本再生成”这个结论上,避免把篇幅浪费在空泛的模型体验描述里。# 用 Gemini 3 做城市攻略短片:真正提效的,不是生成,而是先把脚本拆开
我周末真的做出了一条城市攻略短片,但真正帮我省时间的,不是最后那一下视频生成,而是前面那一步拆脚本。
这件事一开始很容易走偏。很多人会直接丢一句提示词给模型,期待它“一步到位”出片,结果通常是:资料东拼西凑、镜头逻辑散、旁白和画面互相打架,最后还得回头重写。我的目标很简单,就是把 搜索 → 整理 → 生成 串成一条线,看看能不能把一条短视频的内容生产压缩到一个周末内完成。
为什么我想做这件事
场景很具体:我想做一条“城市攻略短片”,长度控制在 30 到 60 秒,内容包括地标、路线、吃喝和一个适合收尾的观点。听起来不复杂,但真做起来,最耗时的从来不是“生成”本身,而是前面的信息整理。
你会反复卡在三件事上:
- 这座城市到底讲什么才有信息密度
- 哪些内容适合镜头呈现,哪些只能放旁白
- 结尾怎么收,才不像说明书
所以这次我没有先写长提示词,而是先把目标拆成机器能理解的任务。我的判断很直接:短视频不是写一段提示词就结束,而是先搭内容骨架,再喂给搜索和生成模型。
真正省时间的是前期拆脚本
我把一条城市攻略短片拆成 5 层:
- 开场钩子
- 路线段落
- 镜头需求
- 旁白句子
- 转场点
这一步看起来慢,实际上是在省返工。因为你一旦把“要讲什么”和“怎么拍出来”分开,后面的搜索就不是漫无目的地找资料,而是带着问题找答案。
完整工作流
搜索 → 信息筛选 → 脚本拆分 → 分镜 → 视频生成 → 复查
这个顺序很重要。先搜索,再生成,往往会把模型推向“像样但空泛”的结果;先拆脚本,再搜索,结果会稳很多,因为你已经知道自己缺的是哪一类信息。
Gemini 3 怎么接搜索和视频生成
我这次的做法是先用 Gemini 3 搜索城市信息,再把结果整理成结构化脚本,最后交给视频生成模块出片。
1. 先搜索,不急着写
搜索阶段我重点找三类内容:
- 城市地标:适合做开场和转场
- 路线信息:适合串起整条视频
- 餐饮/景点素材:适合补视觉密度
这里的关键不是“找到很多”,而是“筛得准”。比如同样是城市攻略,适合镜头的内容通常是能被一眼识别的地标、街景、门头、路线牌;不适合直接交给生成的,是那些需要严格事实核对的细节,比如营业时间、门票规则、是否开放之类。
2. 把搜索结果变成分镜清单
我不会直接把一堆搜索结果扔给生成模型,而是先整理成这种结构:
1. 开场:城市全景 + 一句问题式钩子
2. 地标:一个最容易识别的城市符号
3. 路线:从地标走到核心街区
4. 餐饮:一处高辨识度店面或食物特写
5. 收尾:一句总结 + 下一次再来的理由
这样做的好处是,生成模型拿到的不是“信息垃圾堆”,而是已经能执行的任务单。
3. 哪些交给生成,哪些必须人工确认
这一步最容易翻车。我的原则是:
- 适合交给生成的:氛围镜头、过渡镜头、通用城市街景、节奏性的画面
- 必须人工确认的:地名、路线、营业信息、地标顺序、容易误导的事实
也就是说,生成负责“让片子动起来”,人工负责“让它不跑偏”。
失败样本
我第一次试的时候,给了一个很粗的提示词:
帮我做一条城市攻略短视频,讲这个城市好玩的地方和好吃的东西,画面要高级,节奏快一点,适合社交媒体发布。
结果问题很明显:
- 开场没有明确钩子
- 镜头之间没有路线感
- 旁白说了很多,但画面接不住
- 最后收尾像硬塞一句广告词
这就是典型的“模型知道你想要短视频,但不知道你想要什么结构”。后来我改成结构化脚本后,生成结果才真正能用。
前后对比
粗提示词版本:
帮我做一条城市攻略短视频,介绍这座城市的地标、餐饮和适合打卡的地方,风格轻快一点,画面有质感,适合 30 到 60 秒。
结构化脚本版本:
请根据以下分镜生成 45 秒城市攻略短片:
1. 开场 5 秒
- 画面:城市航拍/街景切换
- 文案:一句问题式钩子,强调“这座城市为什么值得来一次”
2. 地标段 10 秒
- 画面:最具识别度的地标外观
- 文案:一句话说明它代表这座城市什么气质
3. 路线段 10 秒
- 画面:从地标到街区的步行/移动镜头
- 文案:用“顺路”串起下一个点
4. 美食段 10 秒
- 画面:店门头、出餐、特写
- 文案:只保留一个明确卖点,不写过多形容词
5. 结尾 10 秒
- 画面:夜景/人流/收束镜头
- 文案:给出一句总结,并引出下一次再来的理由
约束:
- 不要编造地点信息
- 转场要自然
- 每个镜头都要能独立成立
差别不在“写得更长”,而在“任务更清楚”。
一段可复用的示例脚本
下面是一个 30-60 秒城市攻略短片的模板级分镜,拿去就能改:
标题:第一次来这座城市,先看这 5 个点
0-5秒
画面:城市远景 + 人流推进
旁白:如果只给你半天,你会先看哪一面?
5-15秒
画面:最强地标外观
旁白:先来这里,因为它几乎就是这座城市的名片。
15-25秒
画面:从地标走向街区
旁白:顺着这条路往下走,节奏会立刻变得更像本地人。
25-35秒
画面:餐饮门头 + 出餐特写
旁白:吃的不用贪多,找一个最有辨识度的就够了。
35-45秒
画面:夜景/街道收尾
旁白:这座城市真正舒服的地方,不在打卡点,而在这些连接点。
结尾
画面:慢镜头收束
旁白:下次来,建议留半天只走这一条线。
这个脚本的价值,不在于文案多漂亮,而在于它能直接喂给搜索和生成模块。
这套方法适合谁,不适合谁
适合的人很清楚:
- 做旅行种草
- 做城市攻略
- 做活动预告
- 做轻知识短片
这些内容都有一个共同点:信息可拆、镜头可替代、节奏可模板化。
不适合的也很清楚:
- 强叙事内容
- 强人物关系内容
- 需要大量原创镜头的内容
- 事实极度敏感、不能出错的题材
小白怎么上手?先照着模板做,不要急着追求“全自动”。进阶用户怎么做?把模板变成自己的内容流水线,固定住开场、转场和收尾,把时间留给选题和核对。
我最后的结论
这次实验最重要的收获只有一句:AI 视频生产的瓶颈,不在生成,而在前期信息组织。
AI 不是替你想清楚,而是放大你想清楚的部分。你把脚本拆得越细,把素材边界定得越清楚,后面的搜索越准,生成越稳,返工也越少。
所以真正可执行的结论是:
先把脚本拆成机器能理解的任务,后面的生成才真的快。
如果你想直接拿这套“搜索 + 脚本拆分 + 视频生成”的提示词模板和工作流示例,可以去 api.884819.xyz 看完整接入方式和可复用方案。新用户注册即送体验token。
下一篇我会继续拆:同样是做短视频,怎么把这套流程进一步接成自动化流水线,让选题、脚本、素材和生成尽量少手工操作。
本文由8848AI原创,转载请注明出处。#AI教程 #Gemini3 #视频生成 #Prompt技巧 #城市攻略 #8848AI #人工智能 #内容生产