AI 三分钟写完商品描述,为什么一条都不能直接上架?

AI 用三分钟写完了商品描述,而我接下来花的大部分时间,都在决定那些看似普通的数字到底是什么意思。

如果你做过电商商品上架,大概率见过这样的 Excel:

同一个容量,有人写 500毫升,有人写 500ML,还有人写 0.5L;颜色一栏混着“黑色”“曜石黑”“经典黑”;材质写着“食品级”,却没有说明究竟是 PP、Tritan,还是不锈钢。

更麻烦的是,关键信息并不一定待在正确的列里。容量可能藏在商品名中,尺寸可能写进备注,型号里的数字又可能被误认为规格。

把这些资料交给 AI,它很快就能生成一批语句通顺、卖点完整的商品描述。第一眼看上去,项目似乎已经完成了大半。

直到资料进入上架系统:

  • 必填材质为空;
  • 容量字段不是数值;
  • 颜色不在平台枚举范围内;
  • 尺寸顺序不统一;
  • 商品标题写“儿童可用”,原始资料却没有任何依据;
  • 仍有待确认问题,状态却被标记成“可发布”。

这时才会发现:写完商品文案,与完成商品资料,是两件完全不同的事。

自然语言允许模糊表达,“大容量”“食品级”“轻巧便携”读起来都没问题;结构化数据却不接受这种模糊。一个单位、枚举值或必填项出错,就可能让整批商品无法导入。

第一关不是写文案,而是定义“什么叫正确”

很多团队使用 AI 清洗商品资料时,第一步就是上传整张表,然后说:“帮我整理成标准商品数据。”

这个提示词看似省事,实际上等于把业务规则交给模型临场决定。

模型不知道你的平台要求颜色写“黑色”还是“曜石黑”,不知道尺寸应按“长×宽×高”还是“宽×高×深”排列,也不知道“食品级材质”能否作为材质字段入库。

正确顺序应该反过来:先建立字段字典,再让 AI 按规则处理。

字段字典至少要定义六件事

| 字段 | 数据类型 | 标准单位或格式 | 示例 | 空值规则 | 备注 | | sku | 字符串 | 原样保留 | A1024 | 不允许为空 | 禁止自动改写 | | product_name | 字符串 | 去除无效促销词 | 便携式保温杯 | 不允许为空 | 不补充无依据人群 | | capacity_ml | 整数 | ml | 500 | 允许待确认 | 0.5L 转为 500 | | material | 枚举或字符串 | 具体材质 | 304 不锈钢 | 高风险字段 | “食品级”不等于材质 | | color | 枚举 | 标准色系 | 黑色 | 可为空 | 保留原始营销色名 | | size_mm | 对象 | 长×宽×高 | 70×70×220 | 可为空 | 必须确认维度顺序 |

字段字典不是一张“字段名称对照表”,而是一份数据合同。它需要明确:

1. 字段叫什么;

2. 接受什么数据类型;

3. 使用什么单位;

4. 允许哪些枚举值;

5. 遇到空值如何处理;

6. 哪些字段绝对不能推测。

AI 最适合完成的是字段识别、格式转换、同义词归一和异常标记,而不是替业务人员决定事实。

好的数据清洗不是让 AI 尽可能填满表格,而是让它准确区分“可以转换”和“不能确认”。

用结构化输出限制模型的自由发挥

进阶做法是使用 JSON Schema 或固定 JSON 结构,要求模型同时输出标准值、原始值、置信度和待确认问题。

下面这段提示词可以直接作为起点:

你是商品资料标准化助手。

只根据输入资料整理字段,不得补充输入中不存在的商品事实。

无法确认时将字段设为 null,并在 questions 中说明需要确认的内容。

所有规格必须按照字段字典输出,同时保留原始值和标准化后的值。

处理要求:

1. 单位按字段字典统一;

2. 枚举值只能从允许范围中选择;

3. 不得根据商品名称推测材质、适用人群、认证、成分或功率;

4. 发现不同字段存在冲突时,不要自行选择答案,应写入 questions;

5. 每个标准化字段均返回 confidence;

6. 只输出合法 JSON,不要添加解释性文字。

理想结果不是一段漂亮文案,而是一条可追踪的记录:

{

"sku": "A1024",

"normalized": {

"product_name": "便携式保温杯",

"capacity_ml": 500,

"material": null,

"color": "黑色"

},

"source_values": {

"capacity": "0.5L",

"material": "食品级材质",

"color": "曜石黑"

},

"questions": [

{

"field": "material",

"question": "请确认杯体具体材质,例如 304 不锈钢或 316 不锈钢。",

"priority": "high"

}

],

"confidence": {

"capacity_ml": 0.99,

"material": 0.0,

"color": 0.92

}

}

这里的关键不是 0.99 看起来多么可靠。置信度是模型给出的辅助判断,不是事实证明,不能替代来源核验。

三类数据,必须采用三种处理方式

商品资料中的缺失项不能一概交给 AI“补齐”。更稳妥的做法,是先将它们分成三类。

第一类:可以确定性转换

这类信息虽然写法不同,但语义明确,转换规则也没有歧义。

#### 案例一:容量单位统一

处理前:
SKU:A1024

容量:0.5L

AI 输出:
{

"source_value": "0.5L",

"normalized_value": 500,

"unit": "ml",

"status": "normalized"

}

验收结果:通过。 500毫升500ML0.5L可以统一为数值 500,字段名或单位配置负责表达 ml。这属于规则明确的格式转换,不需要供应商再次确认。

需要注意的是,数据库中最好把数值与单位分开存储。否则 500 ml 仍然是字符串,不利于筛选、排序和区间查询。

第二类:必须向供应商确认

#### 案例二:“食品级”不是具体材质

处理前:
SKU:B2071

材质:食品级材质

错误做法:
{

"material": "PP"

}

模型可能根据常见商品经验猜测 PP,但原始资料并没有提供这个事实。

正确输出:
{

"material": null,

"source_value": "食品级材质",

"questions": [

{

"field": "material",

"question": "请确认商品主体的具体材质,如 PP、Tritan、304 不锈钢等;如不同部件材质不同,请分别提供。",

"priority": "high"

}

]

}

验收结果:退回供应商确认。

商品材质、认证、适用人群、功率、成分等字段,往往涉及安全、合规和消费者决策,禁止无依据生成。即便 AI 猜对了,也没有可审计的来源。

第三类:业务允许暂时为空

有些非必填字段不会阻断上架,例如部分平台上的包装尺寸、次要营销标签或补充说明。

这类字段可以保留为 null,但必须根据平台规则设置状态,不能把“允许为空”和“已经确认”混为一谈。

AI 更重要的能力,是生成可追踪的追问清单

传统处理方式中,运营人员往往要逐行翻 Excel,再把问题散落到微信、邮件和群聊里。供应商回复后,又要人工寻找对应 SKU。

AI 可以把这些问题集中整理成追问表:

| SKU | 缺失字段 | 原始信息 | 需要确认的问题 | 建议选项 | 优先级 | | B2071 | 材质 | 食品级材质 | 主体具体是什么材质? | PP/Tritan/不锈钢/其他 | 高 | | C3108 | 功率 | 未提供 | 请提供额定功率及单位 | W | 高 | | D4216 | 尺寸 | 70×220 | 缺少一个维度,并且顺序不明 | 长×宽×高 | 中 |

每个补充答案还应记录:

  • 回复来源;
  • 回复人员;
  • 原始回复内容;
  • 确认时间;
  • 对应 SKU;
  • 修改前后的字段值。

这样做的价值在于,问题不再是“表里还有几个空格”,而是变成了谁需要回答、回答什么、影响哪些商品、是否已经关闭的任务列表。

AI 最容易犯的错:把“像规格的数字”当成规格

#### 案例三:型号数字被误识别为容量

处理前:
商品名称:X500 便携榨汁杯

型号:X500

容量:未提供

AI 第一次输出:
{

"capacity_ml": 500

}

这条结果看起来非常合理,但没有任何资料证明 X500 中的 500 代表容量。

正确处理:
{

"capacity_ml": null,

"source_value": null,

"questions": [

{

"field": "capacity_ml",

"question": "现有资料仅包含型号 X500,无法确认数字是否代表容量,请提供额定容量。",

"priority": "high"

}

]

}

验收结果:AI 初次结果退回,修正后进入待确认状态。

类似误判还包括:

  • 从“儿童水杯”推导适用年龄;
  • 从“户外电源 1000”推导额定功率;
  • 从“医护级”推导具体认证;
  • 从商品图片颜色推导标准色;
  • 根据同系列其他 SKU 补充当前 SKU 的参数。

这些信息可能“很像真的”,但商品数据治理判断的不是合理性,而是是否有证据

JSON 合法,只代表它能被解析

模型输出以后,还需要通过程序规则校验。最基础的逻辑可以这样写:

def validate_product(item):

errors = []

if not item.get("sku"):

errors.append("缺少 SKU")

capacity = item.get("normalized", {}).get("capacity_ml")

if capacity is not None and capacity <= 0:

errors.append("容量必须大于 0")

material = item.get("normalized", {}).get("material")

if material is None:

errors.append("材质待供应商确认")

if item.get("questions") and item.get("status") == "ready_to_publish":

errors.append("存在未解决问题,不允许标记为可上架")

return errors

真实项目还应继续加入:

  • 字段类型校验;
  • 单位换算校验;
  • 枚举范围校验;
  • SKU 唯一性校验;
  • 标题与规格冲突检查;
  • 禁用词和敏感宣传词检查;
  • 图片、详情页与结构化参数的一致性检查;
  • 目标平台的长度、格式和必填规则。

上架验收,需要三道质量闸门

单独依赖人工,效率太低;单独依赖 AI,又缺少确定性。更可靠的方式是分层验收。

第一层:程序检查格式

程序适合处理确定性规则:

  • 必填项是否为空;
  • JSON 是否合法;
  • 数值是否大于零;
  • 单位是否统一;
  • 枚举值是否合法;
  • 未解决问题是否阻断发布。

第二层:AI 检查语义

AI 更适合发现跨字段问题:

  • 标题写 500 ml,参数却是 600 ml;
  • 商品名写“不锈钢保温杯”,材质字段却是 Tritan;
  • 描述声称“适合婴幼儿”,来源资料没有适用人群;
  • 主图是白色,颜色字段却标为黑色;
  • 同一条记录中出现互相矛盾的尺寸。

第三层:人工确认事实与销售表达

人工重点处理:

  • 高风险字段是否有可靠来源;
  • 供应商回复是否明确;
  • AI 是否改变了事实含义;
  • 卖点表达是否过度;
  • 商品描述是否符合品牌语气;
  • 平台特殊规则是否满足。

一条记录语句通顺,不代表准确;JSON 能解析,不代表字段可用;规格看似完整,也不代表符合平台要求。

可直接使用的验收清单

  • [ ] SKU 存在且唯一
  • [ ] 所有平台必填字段已填写
  • [ ] 数值与单位分离并完成统一
  • [ ] 颜色、材质等枚举值符合字段字典
  • [ ] 尺寸顺序明确,单位一致
  • [ ] 高风险事实有明确来源
  • [ ] 不存在未关闭的高优先级问题
  • [ ] 标题、属性、详情页和图片相互一致
  • [ ] 不包含无依据的功效、认证及绝对化宣传
  • [ ] 满足目标平台的字段长度与格式要求

项目复盘,不要只看“生成了多少条”

为了遵守数据真实性原则,本文不虚构一组漂亮的完整率或通过率。如果准备复用这套流程,建议从一批 50—200 个脱敏 SKU 开始,并从原始表、模型调用日志、供应商追问记录和上架系统中导出以下指标:

| 指标 | 统计方式 | | 原始字段完整率 | 原始非空必填字段数 ÷ 应填必填字段数 | | 清洗后完整率 | 已确认非空必填字段数 ÷ 应填必填字段数 | | 统一字段数量 | 完成单位、颜色、尺寸等归一的字段总数 | | 疑似冲突数量 | AI 标记后经人工确认的冲突数 | | 供应商追问数量 | 不能推导且必须确认的问题数 | | 首次验收通过率 | 首次提交即通过的 SKU 数 ÷ 提交 SKU 数 | | 人工总耗时 | 盘点、复核、追问和返工的实际工时 | | 单 SKU 平均耗时 | 人工总耗时 ÷ SKU 数 | | AI 调用与成本 | 从接口账单和调用日志读取 | | 重试次数 | 因格式错误、超时或结果不合格产生的重试 | | 返工最多字段 | 按字段统计退回次数,取前三项 |

建议在文章或项目报告中配套保留以下脱敏截图:

1. 原始 Excel 的混乱状态;

2. 字段字典和标准枚举表;

3. AI 第一次“看起来很好、实际不能上架”的输出;

4. 自动生成的缺失项追问清单;

5. 校验脚本或上架系统返回的错误;

6. 最终通过验收的结构化记录;

7. 清洗前后的真实指标对比图。

指标必须来自项目日志,不要凭回忆估算,更不要为了证明 AI 有效而补造数字。

一套真正能落地的商品资料流程

回到整个项目,可靠的顺序应该是:

原始资料盘点 → 字段字典 → AI 标准化 → 缺失项追问 → 规则校验 → 人工验收 → 批量上架

AI 没有替代供应商确认,也没有替代业务判断和最终验收。它真正改变的是工作形态:过去需要人工逐行寻找的问题,现在可以批量识别;过去散落在聊天记录里的追问,现在可以集中管理;过去依靠经验完成的检查,现在可以沉淀成规则。

如果你也有一批 Excel、供应商文档或历史商品资料,可以先挑选 5—10 条样本,把本文的字段字典、提示词和 JSON 格式放到 api.884819.xyz 接入模型测试。

不要一开始就跑整批数据,先完成三个小测试:

1. 单位能否稳定统一;

2. 缺失项能否主动生成问题,而不是擅自补全;

3. 相同输入重复运行时,字段结构是否保持稳定。

通过这三关,再接入自动校验和批量上架流程。8848AI 平台使用用户名和密码即可注册,不需要邮箱验证;内置 AI 对话功能,注册后可以直接使用。国产模型如 Deepseek、千问等完全免费,没有月租和订阅,其他模型按量付费。

新用户注册即送体验token。

这次最让我警惕的,并不是模型写错了什么,而是同一份商品资料换一个模型、甚至重新调用一次,字段结构与缺失项判断都可能发生变化。

下一篇,我们不再比较谁的文案更漂亮,而是拿同一批资料测试不同模型:只比较结构化输出稳定性、幻觉风险、调用成本和首次验收通过率。

下一篇建议题目:《同一批商品资料交给不同 AI:我不比文案好不好,只比谁的结构化输出更稳定》

本文由8848AI原创,转载请注明出处。关注8848AI,带你从零开始学AI。

#AI教程 #商品数据治理 #电商运营 #结构化输出 #Prompt技巧 #人工智能 #8848AI