AI 三分钟写完商品描述,为什么一条都不能直接上架?
AI 三分钟写完商品描述,为什么一条都不能直接上架?
AI 用三分钟写完了商品描述,而我接下来花的大部分时间,都在决定那些看似普通的数字到底是什么意思。
如果你做过电商商品上架,大概率见过这样的 Excel:
同一个容量,有人写 500毫升,有人写 500ML,还有人写 0.5L;颜色一栏混着“黑色”“曜石黑”“经典黑”;材质写着“食品级”,却没有说明究竟是 PP、Tritan,还是不锈钢。
更麻烦的是,关键信息并不一定待在正确的列里。容量可能藏在商品名中,尺寸可能写进备注,型号里的数字又可能被误认为规格。
把这些资料交给 AI,它很快就能生成一批语句通顺、卖点完整的商品描述。第一眼看上去,项目似乎已经完成了大半。
直到资料进入上架系统:
- 必填材质为空;
- 容量字段不是数值;
- 颜色不在平台枚举范围内;
- 尺寸顺序不统一;
- 商品标题写“儿童可用”,原始资料却没有任何依据;
- 仍有待确认问题,状态却被标记成“可发布”。
这时才会发现:写完商品文案,与完成商品资料,是两件完全不同的事。
自然语言允许模糊表达,“大容量”“食品级”“轻巧便携”读起来都没问题;结构化数据却不接受这种模糊。一个单位、枚举值或必填项出错,就可能让整批商品无法导入。
第一关不是写文案,而是定义“什么叫正确”
很多团队使用 AI 清洗商品资料时,第一步就是上传整张表,然后说:“帮我整理成标准商品数据。”
这个提示词看似省事,实际上等于把业务规则交给模型临场决定。
模型不知道你的平台要求颜色写“黑色”还是“曜石黑”,不知道尺寸应按“长×宽×高”还是“宽×高×深”排列,也不知道“食品级材质”能否作为材质字段入库。
正确顺序应该反过来:先建立字段字典,再让 AI 按规则处理。
字段字典至少要定义六件事
| 字段 | 数据类型 | 标准单位或格式 | 示例 | 空值规则 | 备注 | |sku | 字符串 | 原样保留 | A1024 | 不允许为空 | 禁止自动改写 |
| product_name | 字符串 | 去除无效促销词 | 便携式保温杯 | 不允许为空 | 不补充无依据人群 |
| capacity_ml | 整数 | ml | 500 | 允许待确认 | 0.5L 转为 500 |
| material | 枚举或字符串 | 具体材质 | 304 不锈钢 | 高风险字段 | “食品级”不等于材质 |
| color | 枚举 | 标准色系 | 黑色 | 可为空 | 保留原始营销色名 |
| size_mm | 对象 | 长×宽×高 | 70×70×220 | 可为空 | 必须确认维度顺序 |
字段字典不是一张“字段名称对照表”,而是一份数据合同。它需要明确:
1. 字段叫什么;
2. 接受什么数据类型;
3. 使用什么单位;
4. 允许哪些枚举值;
5. 遇到空值如何处理;
6. 哪些字段绝对不能推测。
AI 最适合完成的是字段识别、格式转换、同义词归一和异常标记,而不是替业务人员决定事实。
好的数据清洗不是让 AI 尽可能填满表格,而是让它准确区分“可以转换”和“不能确认”。
用结构化输出限制模型的自由发挥
进阶做法是使用 JSON Schema 或固定 JSON 结构,要求模型同时输出标准值、原始值、置信度和待确认问题。
下面这段提示词可以直接作为起点:
你是商品资料标准化助手。
只根据输入资料整理字段,不得补充输入中不存在的商品事实。
无法确认时将字段设为 null,并在 questions 中说明需要确认的内容。
所有规格必须按照字段字典输出,同时保留原始值和标准化后的值。
处理要求:
1. 单位按字段字典统一;
2. 枚举值只能从允许范围中选择;
3. 不得根据商品名称推测材质、适用人群、认证、成分或功率;
4. 发现不同字段存在冲突时,不要自行选择答案,应写入 questions;
5. 每个标准化字段均返回 confidence;
6. 只输出合法 JSON,不要添加解释性文字。
理想结果不是一段漂亮文案,而是一条可追踪的记录:
{
"sku": "A1024",
"normalized": {
"product_name": "便携式保温杯",
"capacity_ml": 500,
"material": null,
"color": "黑色"
},
"source_values": {
"capacity": "0.5L",
"material": "食品级材质",
"color": "曜石黑"
},
"questions": [
{
"field": "material",
"question": "请确认杯体具体材质,例如 304 不锈钢或 316 不锈钢。",
"priority": "high"
}
],
"confidence": {
"capacity_ml": 0.99,
"material": 0.0,
"color": 0.92
}
}
这里的关键不是 0.99 看起来多么可靠。置信度是模型给出的辅助判断,不是事实证明,不能替代来源核验。
三类数据,必须采用三种处理方式
商品资料中的缺失项不能一概交给 AI“补齐”。更稳妥的做法,是先将它们分成三类。
第一类:可以确定性转换
这类信息虽然写法不同,但语义明确,转换规则也没有歧义。
#### 案例一:容量单位统一
处理前:SKU:A1024
容量:0.5L
AI 输出:
{
"source_value": "0.5L",
"normalized_value": 500,
"unit": "ml",
"status": "normalized"
}
验收结果:通过。
500毫升、500ML、0.5L可以统一为数值 500,字段名或单位配置负责表达 ml。这属于规则明确的格式转换,不需要供应商再次确认。
需要注意的是,数据库中最好把数值与单位分开存储。否则 500 ml 仍然是字符串,不利于筛选、排序和区间查询。
第二类:必须向供应商确认
#### 案例二:“食品级”不是具体材质
处理前:SKU:B2071
材质:食品级材质
错误做法:
{
"material": "PP"
}
模型可能根据常见商品经验猜测 PP,但原始资料并没有提供这个事实。
正确输出:{
"material": null,
"source_value": "食品级材质",
"questions": [
{
"field": "material",
"question": "请确认商品主体的具体材质,如 PP、Tritan、304 不锈钢等;如不同部件材质不同,请分别提供。",
"priority": "high"
}
]
}
验收结果:退回供应商确认。
商品材质、认证、适用人群、功率、成分等字段,往往涉及安全、合规和消费者决策,禁止无依据生成。即便 AI 猜对了,也没有可审计的来源。
第三类:业务允许暂时为空
有些非必填字段不会阻断上架,例如部分平台上的包装尺寸、次要营销标签或补充说明。
这类字段可以保留为 null,但必须根据平台规则设置状态,不能把“允许为空”和“已经确认”混为一谈。
AI 更重要的能力,是生成可追踪的追问清单
传统处理方式中,运营人员往往要逐行翻 Excel,再把问题散落到微信、邮件和群聊里。供应商回复后,又要人工寻找对应 SKU。
AI 可以把这些问题集中整理成追问表:
| SKU | 缺失字段 | 原始信息 | 需要确认的问题 | 建议选项 | 优先级 | | B2071 | 材质 | 食品级材质 | 主体具体是什么材质? | PP/Tritan/不锈钢/其他 | 高 | | C3108 | 功率 | 未提供 | 请提供额定功率及单位 | W | 高 | | D4216 | 尺寸 | 70×220 | 缺少一个维度,并且顺序不明 | 长×宽×高 | 中 |每个补充答案还应记录:
- 回复来源;
- 回复人员;
- 原始回复内容;
- 确认时间;
- 对应 SKU;
- 修改前后的字段值。
这样做的价值在于,问题不再是“表里还有几个空格”,而是变成了谁需要回答、回答什么、影响哪些商品、是否已经关闭的任务列表。
AI 最容易犯的错:把“像规格的数字”当成规格
#### 案例三:型号数字被误识别为容量
处理前:商品名称:X500 便携榨汁杯
型号:X500
容量:未提供
AI 第一次输出:
{
"capacity_ml": 500
}
这条结果看起来非常合理,但没有任何资料证明 X500 中的 500 代表容量。
{
"capacity_ml": null,
"source_value": null,
"questions": [
{
"field": "capacity_ml",
"question": "现有资料仅包含型号 X500,无法确认数字是否代表容量,请提供额定容量。",
"priority": "high"
}
]
}
验收结果:AI 初次结果退回,修正后进入待确认状态。
类似误判还包括:
- 从“儿童水杯”推导适用年龄;
- 从“户外电源 1000”推导额定功率;
- 从“医护级”推导具体认证;
- 从商品图片颜色推导标准色;
- 根据同系列其他 SKU 补充当前 SKU 的参数。
这些信息可能“很像真的”,但商品数据治理判断的不是合理性,而是是否有证据。
JSON 合法,只代表它能被解析
模型输出以后,还需要通过程序规则校验。最基础的逻辑可以这样写:
def validate_product(item):
errors = []
if not item.get("sku"):
errors.append("缺少 SKU")
capacity = item.get("normalized", {}).get("capacity_ml")
if capacity is not None and capacity <= 0:
errors.append("容量必须大于 0")
material = item.get("normalized", {}).get("material")
if material is None:
errors.append("材质待供应商确认")
if item.get("questions") and item.get("status") == "ready_to_publish":
errors.append("存在未解决问题,不允许标记为可上架")
return errors
真实项目还应继续加入:
- 字段类型校验;
- 单位换算校验;
- 枚举范围校验;
- SKU 唯一性校验;
- 标题与规格冲突检查;
- 禁用词和敏感宣传词检查;
- 图片、详情页与结构化参数的一致性检查;
- 目标平台的长度、格式和必填规则。
上架验收,需要三道质量闸门
单独依赖人工,效率太低;单独依赖 AI,又缺少确定性。更可靠的方式是分层验收。
第一层:程序检查格式
程序适合处理确定性规则:
- 必填项是否为空;
- JSON 是否合法;
- 数值是否大于零;
- 单位是否统一;
- 枚举值是否合法;
- 未解决问题是否阻断发布。
第二层:AI 检查语义
AI 更适合发现跨字段问题:
- 标题写 500 ml,参数却是 600 ml;
- 商品名写“不锈钢保温杯”,材质字段却是 Tritan;
- 描述声称“适合婴幼儿”,来源资料没有适用人群;
- 主图是白色,颜色字段却标为黑色;
- 同一条记录中出现互相矛盾的尺寸。
第三层:人工确认事实与销售表达
人工重点处理:
- 高风险字段是否有可靠来源;
- 供应商回复是否明确;
- AI 是否改变了事实含义;
- 卖点表达是否过度;
- 商品描述是否符合品牌语气;
- 平台特殊规则是否满足。
一条记录语句通顺,不代表准确;JSON 能解析,不代表字段可用;规格看似完整,也不代表符合平台要求。
可直接使用的验收清单
- [ ] SKU 存在且唯一
- [ ] 所有平台必填字段已填写
- [ ] 数值与单位分离并完成统一
- [ ] 颜色、材质等枚举值符合字段字典
- [ ] 尺寸顺序明确,单位一致
- [ ] 高风险事实有明确来源
- [ ] 不存在未关闭的高优先级问题
- [ ] 标题、属性、详情页和图片相互一致
- [ ] 不包含无依据的功效、认证及绝对化宣传
- [ ] 满足目标平台的字段长度与格式要求
项目复盘,不要只看“生成了多少条”
为了遵守数据真实性原则,本文不虚构一组漂亮的完整率或通过率。如果准备复用这套流程,建议从一批 50—200 个脱敏 SKU 开始,并从原始表、模型调用日志、供应商追问记录和上架系统中导出以下指标:
| 指标 | 统计方式 | | 原始字段完整率 | 原始非空必填字段数 ÷ 应填必填字段数 | | 清洗后完整率 | 已确认非空必填字段数 ÷ 应填必填字段数 | | 统一字段数量 | 完成单位、颜色、尺寸等归一的字段总数 | | 疑似冲突数量 | AI 标记后经人工确认的冲突数 | | 供应商追问数量 | 不能推导且必须确认的问题数 | | 首次验收通过率 | 首次提交即通过的 SKU 数 ÷ 提交 SKU 数 | | 人工总耗时 | 盘点、复核、追问和返工的实际工时 | | 单 SKU 平均耗时 | 人工总耗时 ÷ SKU 数 | | AI 调用与成本 | 从接口账单和调用日志读取 | | 重试次数 | 因格式错误、超时或结果不合格产生的重试 | | 返工最多字段 | 按字段统计退回次数,取前三项 |建议在文章或项目报告中配套保留以下脱敏截图:
1. 原始 Excel 的混乱状态;
2. 字段字典和标准枚举表;
3. AI 第一次“看起来很好、实际不能上架”的输出;
4. 自动生成的缺失项追问清单;
5. 校验脚本或上架系统返回的错误;
6. 最终通过验收的结构化记录;
7. 清洗前后的真实指标对比图。
指标必须来自项目日志,不要凭回忆估算,更不要为了证明 AI 有效而补造数字。一套真正能落地的商品资料流程
回到整个项目,可靠的顺序应该是:
原始资料盘点 → 字段字典 → AI 标准化 → 缺失项追问 → 规则校验 → 人工验收 → 批量上架
AI 没有替代供应商确认,也没有替代业务判断和最终验收。它真正改变的是工作形态:过去需要人工逐行寻找的问题,现在可以批量识别;过去散落在聊天记录里的追问,现在可以集中管理;过去依靠经验完成的检查,现在可以沉淀成规则。
如果你也有一批 Excel、供应商文档或历史商品资料,可以先挑选 5—10 条样本,把本文的字段字典、提示词和 JSON 格式放到 api.884819.xyz 接入模型测试。
不要一开始就跑整批数据,先完成三个小测试:
1. 单位能否稳定统一;
2. 缺失项能否主动生成问题,而不是擅自补全;
3. 相同输入重复运行时,字段结构是否保持稳定。
通过这三关,再接入自动校验和批量上架流程。8848AI 平台使用用户名和密码即可注册,不需要邮箱验证;内置 AI 对话功能,注册后可以直接使用。国产模型如 Deepseek、千问等完全免费,没有月租和订阅,其他模型按量付费。
新用户注册即送体验token。这次最让我警惕的,并不是模型写错了什么,而是同一份商品资料换一个模型、甚至重新调用一次,字段结构与缺失项判断都可能发生变化。
下一篇,我们不再比较谁的文案更漂亮,而是拿同一批资料测试不同模型:只比较结构化输出稳定性、幻觉风险、调用成本和首次验收通过率。
下一篇建议题目:《同一批商品资料交给不同 AI:我不比文案好不好,只比谁的结构化输出更稳定》
本文由8848AI原创,转载请注明出处。关注8848AI,带你从零开始学AI。#AI教程 #商品数据治理 #电商运营 #结构化输出 #Prompt技巧 #人工智能 #8848AI