我先把文章骨架压成可直接发布的版本,再补上工作流、对比示例和可复用模板。重点会放在“先拆脚本再生成”这个结论上,避免把篇幅浪费在空泛的模型体验描述里。# 用 Gemini 3 做城市攻略短片:真正提效的,不是生成,而是先把脚本拆开

我周末真的做出了一条城市攻略短片,但真正帮我省时间的,不是最后那一下视频生成,而是前面那一步拆脚本。

这件事一开始很容易走偏。很多人会直接丢一句提示词给模型,期待它“一步到位”出片,结果通常是:资料东拼西凑、镜头逻辑散、旁白和画面互相打架,最后还得回头重写。我的目标很简单,就是把 搜索 → 整理 → 生成 串成一条线,看看能不能把一条短视频的内容生产压缩到一个周末内完成。

为什么我想做这件事

场景很具体:我想做一条“城市攻略短片”,长度控制在 30 到 60 秒,内容包括地标、路线、吃喝和一个适合收尾的观点。听起来不复杂,但真做起来,最耗时的从来不是“生成”本身,而是前面的信息整理。

你会反复卡在三件事上:

  • 这座城市到底讲什么才有信息密度
  • 哪些内容适合镜头呈现,哪些只能放旁白
  • 结尾怎么收,才不像说明书

所以这次我没有先写长提示词,而是先把目标拆成机器能理解的任务。我的判断很直接:短视频不是写一段提示词就结束,而是先搭内容骨架,再喂给搜索和生成模型。

真正省时间的是前期拆脚本

我把一条城市攻略短片拆成 5 层:

  • 开场钩子
  • 路线段落
  • 镜头需求
  • 旁白句子
  • 转场点

这一步看起来慢,实际上是在省返工。因为你一旦把“要讲什么”和“怎么拍出来”分开,后面的搜索就不是漫无目的地找资料,而是带着问题找答案。

完整工作流

搜索 → 信息筛选 → 脚本拆分 → 分镜 → 视频生成 → 复查

这个顺序很重要。先搜索,再生成,往往会把模型推向“像样但空泛”的结果;先拆脚本,再搜索,结果会稳很多,因为你已经知道自己缺的是哪一类信息。

Gemini 3 怎么接搜索和视频生成

我这次的做法是先用 Gemini 3 搜索城市信息,再把结果整理成结构化脚本,最后交给视频生成模块出片。

1. 先搜索,不急着写

搜索阶段我重点找三类内容:

  • 城市地标:适合做开场和转场
  • 路线信息:适合串起整条视频
  • 餐饮/景点素材:适合补视觉密度

这里的关键不是“找到很多”,而是“筛得准”。比如同样是城市攻略,适合镜头的内容通常是能被一眼识别的地标、街景、门头、路线牌;不适合直接交给生成的,是那些需要严格事实核对的细节,比如营业时间、门票规则、是否开放之类。

2. 把搜索结果变成分镜清单

我不会直接把一堆搜索结果扔给生成模型,而是先整理成这种结构:

1. 开场:城市全景 + 一句问题式钩子

2. 地标:一个最容易识别的城市符号

3. 路线:从地标走到核心街区

4. 餐饮:一处高辨识度店面或食物特写

5. 收尾:一句总结 + 下一次再来的理由

这样做的好处是,生成模型拿到的不是“信息垃圾堆”,而是已经能执行的任务单。

3. 哪些交给生成,哪些必须人工确认

这一步最容易翻车。我的原则是:

  • 适合交给生成的:氛围镜头、过渡镜头、通用城市街景、节奏性的画面
  • 必须人工确认的:地名、路线、营业信息、地标顺序、容易误导的事实

也就是说,生成负责“让片子动起来”,人工负责“让它不跑偏”。

失败样本

我第一次试的时候,给了一个很粗的提示词:

帮我做一条城市攻略短视频,讲这个城市好玩的地方和好吃的东西,画面要高级,节奏快一点,适合社交媒体发布。

结果问题很明显:

  • 开场没有明确钩子
  • 镜头之间没有路线感
  • 旁白说了很多,但画面接不住
  • 最后收尾像硬塞一句广告词

这就是典型的“模型知道你想要短视频,但不知道你想要什么结构”。后来我改成结构化脚本后,生成结果才真正能用。

前后对比

粗提示词版本:

帮我做一条城市攻略短视频,介绍这座城市的地标、餐饮和适合打卡的地方,风格轻快一点,画面有质感,适合 30 到 60 秒。

结构化脚本版本:

请根据以下分镜生成 45 秒城市攻略短片:

1. 开场 5 秒

  • 画面:城市航拍/街景切换
  • 文案:一句问题式钩子,强调“这座城市为什么值得来一次”

2. 地标段 10 秒

  • 画面:最具识别度的地标外观
  • 文案:一句话说明它代表这座城市什么气质

3. 路线段 10 秒

  • 画面:从地标到街区的步行/移动镜头
  • 文案:用“顺路”串起下一个点

4. 美食段 10 秒

  • 画面:店门头、出餐、特写
  • 文案:只保留一个明确卖点,不写过多形容词

5. 结尾 10 秒

  • 画面:夜景/人流/收束镜头
  • 文案:给出一句总结,并引出下一次再来的理由

约束:

  • 不要编造地点信息
  • 转场要自然
  • 每个镜头都要能独立成立

差别不在“写得更长”,而在“任务更清楚”。

一段可复用的示例脚本

下面是一个 30-60 秒城市攻略短片的模板级分镜,拿去就能改:

标题:第一次来这座城市,先看这 5 个点

0-5秒

画面:城市远景 + 人流推进

旁白:如果只给你半天,你会先看哪一面?

5-15秒

画面:最强地标外观

旁白:先来这里,因为它几乎就是这座城市的名片。

15-25秒

画面:从地标走向街区

旁白:顺着这条路往下走,节奏会立刻变得更像本地人。

25-35秒

画面:餐饮门头 + 出餐特写

旁白:吃的不用贪多,找一个最有辨识度的就够了。

35-45秒

画面:夜景/街道收尾

旁白:这座城市真正舒服的地方,不在打卡点,而在这些连接点。

结尾

画面:慢镜头收束

旁白:下次来,建议留半天只走这一条线。

这个脚本的价值,不在于文案多漂亮,而在于它能直接喂给搜索和生成模块。

这套方法适合谁,不适合谁

适合的人很清楚:

  • 做旅行种草
  • 做城市攻略
  • 做活动预告
  • 做轻知识短片

这些内容都有一个共同点:信息可拆、镜头可替代、节奏可模板化。

不适合的也很清楚:

  • 强叙事内容
  • 强人物关系内容
  • 需要大量原创镜头的内容
  • 事实极度敏感、不能出错的题材

小白怎么上手?先照着模板做,不要急着追求“全自动”。进阶用户怎么做?把模板变成自己的内容流水线,固定住开场、转场和收尾,把时间留给选题和核对。

我最后的结论

这次实验最重要的收获只有一句:AI 视频生产的瓶颈,不在生成,而在前期信息组织。

AI 不是替你想清楚,而是放大你想清楚的部分。你把脚本拆得越细,把素材边界定得越清楚,后面的搜索越准,生成越稳,返工也越少。

所以真正可执行的结论是:

先把脚本拆成机器能理解的任务,后面的生成才真的快。

如果你想直接拿这套“搜索 + 脚本拆分 + 视频生成”的提示词模板和工作流示例,可以去 api.884819.xyz 看完整接入方式和可复用方案。新用户注册即送体验token。

下一篇我会继续拆:同样是做短视频,怎么把这套流程进一步接成自动化流水线,让选题、脚本、素材和生成尽量少手工操作。

本文由8848AI原创,转载请注明出处。

#AI教程 #Gemini3 #视频生成 #Prompt技巧 #城市攻略 #8848AI #人工智能 #内容生产