基于大模型的电商商品资料包智能体检助手实战

发布时间:2026/9/7 9:00:18
基于大模型的电商商品资料包智能体检助手实战 做电商这么久上架链接前最烦的事情是什么不是P图不是写文案是检查那堆没完没了的资料。标题是否超字数详情页有没有极限词规格参数和实物图能不能对上资质文件在不在有效期内——这套流程纯靠人工肉眼核对费时费力不说还容易漏。前阵子我拿 Qwen3.8-Max 搭了一个商品资料包体检助手把 6 份文档和 1 张商品图一次性丢进去两分钟不到它给我列了 27 个问题。从标题关键词堆砌到详情页错别字再到参数表里那个明显写错的净含量一个都没漏。这篇文章就把整个搭建思路、提示词写法、踩过的坑完整记录下来给同样被上架资料折磨的运营和技术朋友一个参考。1. 商品资料包体检到底在查什么很多人一听“商品资料体检”第一反应是“这不就是检查错别字嘛”。真不是。电商平台的规则一年比一年细商品资料包涵盖的维度杂得很光靠关键词屏蔽和正则校验根本覆盖不全。1.1 为什么人工检查总会出现漏网之鱼先说说我为什么会想搞这个东西。上个月运营同事上架一款食品礼盒所有资料都过了一遍结果还是出了岔子详情页里写“全网销量第一”主图上印着“顶级原料”这两处都是平台明确禁止的极限词链接刚提交就被系统拦截了。运营很委屈说检查的时候真的没看到。这个事我后来复盘过问题在于人眼扫读长文本的时候很容易产生“视觉盲区”。尤其是当一份详情页文案有两千多字里面密集出现“最好”“第一”“极致”这类词时大脑会自动把它们当成普通形容词处理根本不会触发警觉。再加上商品资料往往分散在多个文件里运营手里一份 Excel 参数表美工手里一份 PSD 设计稿文案手里一份 Word 详情页大家各看各的没人能从头到尾串起来核对一遍。这就是典型的“信息孤岛”问题。标题、参数、图片、详情页文案、资质文件本来是描述同一个商品的不同侧面但它们分散在不同人、不同格式里一致性检查就成了一个巨大的坑。比如参数表里写“保质期 12 个月”详情页却写“保质期 18 个月”这种矛盾除非逐字对比否则极难发现。1.2 6 份资料和 1 张商品图体检范围怎么界定这次的体检对象是一套完整的食品类商品资料包总共包含 6 份资料和 1 张商品主图具体是这样的资料编号资料名称格式主要体检维度资料 1商品标题与卖点提炼Word字数、关键词堆砌、极限词、违禁词资料 2详情页文案Word错别字、极限词、描述与参数一致性资料 3规格参数表Excel必填项缺失、数值单位错误、字段命名不规范资料 4价格与促销说明Word价格一致性、促销价与原价关系、划线价合规资料 5质检报告与资质文件PDF有效期、编号格式、发证机构、产品名称一致性资料 6售后与物流说明Word服务承诺、退换货政策、时效表述合规附加文件商品主图JPG分辨率、文字信息、主图与文案一致性当一个语言模型来做这件事的时候它不能只看单个文件它需要能够把 6 份资料里的信息互相勾连起来。比如资料 5 质检报告上的产品名称是“XX牌坚果礼盒 1.2kg 装”而资料 1 的标题里写的是“XX牌坚果大礼包”这两个名称的差异如果不跨文件比对根本不会被发现。但平台审核时如果认为产品名称不一致会直接判定为信息虚假。这种交叉验证恰恰是大模型最擅长的事。2. 技术选型为什么用 Qwen3.8-Max 而不是老老实实写规则脚本确定要做体检助手以后第一个问题就是技术路线选什么。直觉反应是传统方案写一个 Python 脚本用正则匹配极限词库用 openpyxl 检查 Excel 必填项用 PdfPlumber 提取 PDF 文本。这套方案用了很多年也不是不行但它有几个硬伤很难解决。2.1 规则脚本有三个绕不过去的短板前两个短板很明显。第一极限词库和违禁词库是动态变化的平台规则每隔一段时间就会调整你手动维护词库的速度永远跟不上平台更新的速度第二规则脚本只能做“局部匹配”它没法理解语义。举例来说“经检测产品未检出塑化剂”这句话里出现了“检出”如果词库里恰好有“检出”作为敏感词这条就会被误判。但人眼看一下就知道这是合规表述根本没问题。上下文理解这件事正则表达式永远做不到。第三个短板是最致命的规则脚本无法做跨文档的一致性校验。资料 1 的标题和资料 3 的参数表是两份不同格式的文件规则脚本只能分别校验它们各自是否符合格式规范但没法判断它们描述的到底是不是同一个商品。需要把两个文件的信息抽取出来做语义对齐再判断矛盾这已经超出了规则脚本的能力边界。2.2 Qwen3.8-Max 在长文本和图文理解上的能力匹配选 Qwen3.8-Max 之前我也对比过其他几个模型。当时手头测试的数据是 7 份文件加起来大概 9000 多字其中规格参数表是比较复杂的合并单元格表格商品主图是小字密集的促销图。对模型的要求有三点长上下文不能丢信息、表格结构要能还原、图片上的小字要能准确识别并和文案内容做交叉比对。Qwen3.8-Max 在这三点的实测表现都符合预期。表格理解这块比较关键Excel 里经常出现“净含量/规格1.2kg25g×48 袋”这种复合单元格普通模型容易把括号里的内容当成独立行来处理但它能把这个字段完整解析出来。图片方面主图上印的“买一赠一”促销标签模型能识别出这个文字信息然后与资料 4 的价格说明做比对这属于多模态对齐能力不是简单 OCR 能搞定的。另一个选它的原因是它的输出稳定性。体检场景最难办的是“漏报”模型漏掉一个敏感词意味着这个错误会带着风险直接上架。我做了八组测试提示词也就是同一个资料包换了八种不同的提示词写法Qwen3.8-Max 对极限词的检出率保持在比较稳定的水平没有出现某一种写法下漏报特别严重的情况。2.3 整体架构与数据流转设计整个体检助手的架构并不复杂核心是一个“输入标准化 → 规则注入 → 模型推理 → 结果结构化”的四段式流程资料包文件Word/Excel/PDF/JPG → 文字提取与转写 → Qwen3.8-Max 体检推理规则注入 交叉验证 → 问题清单按严重级别分级这四段里最容易被低估的是第一步。很多人拿到一份 Word 就想着直接丢给模型实际上 Word 里的页眉页脚、表格嵌套、图片注释都会干扰模型的判断。如果一份详情页文案的页脚有“最终解释权归本店所有”这份材料本身就有合规风险但如果你不做文字提取直接给模型模型可能把页脚和正文混在一起反而判断不出这句话出现在什么位置。我实际做的时候是先把所有文件转成统一的纯文本格式同时保留段落标记和页码标记这样模型能够区分哪些文字在正文、哪些在页面附属区域。提示词设计是第二步的重量级工作这个环节决定了体检的深度我会在下一节展开细说。3. 实操过程提示词设计、图文交叉验证与 27 个问题的产出从确定方案到跑通第一条完整链路前后大概花了三天时间。第一天做数据标准化第二天调提示词第三天做测试和修 bug。下面把关键环节拆开讲。3.1 第一步把多格式资料标准化成“半结构化文本”这一步的产出直接影响后续体检质量。我的做法不是简单把 PDF 转成 txt 就完事而是按文件类型分策略处理Word 文件用 python-docx 读取保留标题层级Heading 1/2/3控制表格行转为竖线分隔的文本行并在每个段落前标注页码。Excel 参数表用 openpyxl 读取全部单元格遇到合并单元格时按“左上角值填充”处理这样模型看到的是一个完整的二维结构不会因为合并单元格而漏读。PDF 质检报告用 pdfplumber 提取文本特别保留“报告编号”“签发日期”“有效期限”等关键字段的位置信息。商品主图用 Qwen3.8-Max 的视觉能力直接读图不只是提取上面的文字还要让模型描述图片的整体布局和商品外观。标准化之后的资料会拼成一份长文本按照“资料 1 标题资料”“资料 2 详情页”“资料 3 规格参数”“资料 4 价格促销”“资料 5 资质文件”“资料 6 售后物流”“附图描述”的顺序排列。顺序本身也是信息模型结合顺序能够理解各个部分之间的逻辑关系。3.2 第二步写一份能约束模型行为的体检提示词提示词是整个系统的灵魂。第一次跑测试的时候我把资料一股脑丢进去只说了一句“帮我检查这些资料的错误”结果模型给我返回了一堆正确的废话像“建议核对标题”“注意图片规范”这类毫无操作性的内容。问题在于提示词太宽泛模型不知道该以什么标准去体检。后来我把提示词拆成了四个层级第一层角色与任务说明。明确告诉模型“你是电商平台资深商品审核员负责在上架前对商品资料包进行合规性、一致性和完整性检查。”给模型一个明确的角色它的判断标准会向专业审核员靠拢。第二层体检维度定义。不要笼统说“检查错误”要列清楚它到底要查哪些维度标题字数与关键词密度、文本中的极限词和违禁词、规格参数表的必填项与单位、多文件之间的产品名称一致性、价格与促销逻辑、资质文件的有效期与编号格式、主图文字与文案内容的一致性。第三层规则注入。把平台明令禁止的极限词列表直接写进提示词同时也要写明一些“例外规则”。比如“极品”这个词在普通商品描述里是违禁的但在茶叶类目里有“极品”等级茶叶是合规的。如果没有例外规则模型就会一刀切误报反而增加人工复核成本。第四层输出格式约束。要求模型按分级清单输出问题每个问题必须包含问题描述、所在文件与位置、严重级别高/中/低、修改建议。这样可以省掉后续解析模型输出的功夫直接用结构化数据生成报告。这里附一份核心提示词的简化版供参考你是电商平台资深审核员请严格依据“电商内容合规规范”对给定的商品资料包进行体检。 体检维度 1. 标题规范字数是否超限≤60字符、是否堆砌关键词、是否含违禁词。 2. 文本规范详情页与标题是否含极限词最、第一、顶级、绝对、全网独创等或敏感引流词。 3. 参数一致规格参数表中必填项是否完整、单位是否正确并与标题、详情页交叉比对。 4. 图文一致图片中的促销信息如赠品、价格、折扣与文案是否一致。 5. 资质合规质检报告有效期是否覆盖当前日期产品名称与标题描述是否一致。 6. 售后规范退换货政策、物流时效承诺是否符合平台规则。 判定要求 - 极限词命中但属于法定标准用语如“最先进技术”在专利资质文件中时不判违规注明“例外”。 - 跨文件比对时如发现名称、规格、价格等不一致判为高严重级别问题。 输出格式 按 CSV 表格字段输出编号文件来源位置/页码问题类型问题描述严重级别建议修改方式。这份提示词跑了三轮迭代才稳定下来。第一轮的问题是多维度任务在长文本上“顾头不顾尾”前面的维度查得细后面的维度就开始敷衍。解决方式是在输出格式里要求必须逐维度输出一个维度都不准跳过这样模型的注意力会被强制拉回到每个检查项上。3.3 第三步跑完整链路拿到 27 个问题的全过程记录提示词确定之后我把标准化好的资料丢给模型控制台开始跑。整个推理过程大约用了 90 秒主要是图片识别和长文本交叉比对比较耗时。输出的结果让我挺意外——它一次性给出了 27 个问题而且很多问题是人工检查时没有发现的。这 27 个问题的分布我统计了一下严重级别数量典型示例高7详情页出现“顶级原料”极限词产品名称在标题与质检报告间不一致主图标注“买一赠一”但价格说明里无赠品规则规格参数表净含量与详情页描述不符中11标题 58 个字符接近上限参数表缺“储藏方法”必填项产地信息在详情页和参数表中名称不统一售后服务承诺超出平台“七天无理由”范围低9两处错别字单位格式不统一kg/KG 混用段落间距不规范主图分辨率低于平台建议值商品卖点正文与标题关键词重复率偏高我逐个核对了这 27 个问题没有明显的误报。最让我惊讶的是两条一是规格参数表里的“净含量 1.2kg”和详情页文案里的“净含量 1200g”表面上数值一样但模型判断单位书写方式不一致且平台对“克重标识”的规范要求是统一这属于细节问题人工几乎不会注意到。二是在质检报告扫描版 PDF 里模型发现产品名称“XX牌每日坚果礼盒”少了“每日”两个字这个差别肉眼真的很难发现但平台审核时产品名称必须一字不差。这一轮跑通之后我对大模型处理这种结构化、规则化任务的能力有了新的认识。它不像传统脚本那样只会做事前定义好的检查它能在理解内容的基础上自动发现未知的问题类型这是它真正的价值所在。4. 常见问题与排查技巧实录写到这里必须分享一下踩过的坑。第一版提示词跑出来的结果可以用“惨不忍睹”来形容大概三分之一的问题是误报剩下的问题里有一半描述含糊不清。后面通过不断调优准确率才慢慢提上来。4.1 坑一Excel 表格识别错乱导致参数一致性误报第一次跑体检的时候模型报了一条“规格参数表中产品毛重为 1.5kg详情页中毛重为 1.2kg”。我核对了原文件发现参数表里根本没有毛重 1.5kg详情页也没说 1.2kg。这个误报是什么原因后来查出来是 openpyxl 读取合并单元格时没有正确处理空值继承导致某一行的数据错位毛重字段被塞进了上一行的数据。这个问题的教训是解析 Excel 时一定要做“空值填充 行列索引校验”。合并单元格的读取策略必须显式指定取左上角的值填充合并区域的所有单元格否则任何依赖于位置的数据提取都会错位。我在代码里加了一个表格结构自检步骤——读取完先检查表头是否完整、行数是否匹配、关键字段是否有值全部通过再进行下一步。4.2 坑二主图文字与文案比对时“过度联想”商品主图上有一行小字“新老包装随机发货”。模型读图后报了一个高严重级别问题“主图提示随机发货与售后说明中‘包装以实物为准’的表述存在差异”。我当时一看就觉得不对这两个说法并不矛盾一个是发货规则一个是包装说明本质上是一致的模型显然读图读得太“发散”了做了超出资料本身的推断。解决方式是在提示词里加了一条硬性约束“图文比对时仅在检测到两个描述针对同一属性且数值或状态明确冲突时才判定为不一致。严禁基于语义联想推断矛盾。”加了这个约束以后这类误报基本消掉了。4.3 坑三模型“幻觉”出原文里不存在的问题有一次模型报了一个问题“标题中包含‘国家级’字样可能涉及违禁词”。但原资料里标题明明是“国家地理标志产品认证”这是合规的产地认证表述。这就是模型的幻觉它没有区分“违禁词规则”和“具体词条上下文”把规则本身当成了判断依据。针对这个问题我在提示词里增加了“判定依据必须引用原文片段”的要求每条问题后面必须写清楚命中的原文是什么不提供原文引用的判罚一律视为无效。这让模型在“报告问题”和“引用原文”之间建立了强关联后续幻觉率降到了很低水平。4.4 坑四长文本批量处理时上下文丢失整套资料加起来接近一万字单次输入模型处理确实会吃力尤其是当提示词本身就占据了两千多字的情况下模型的注意力会更多地放在提示词部分对资料的关注度自然弱化。我测试下来在上下文超过一万字之后跨文件比对部分开始出现漏检。解决办法是分块处理先按文件类型分组检查每两个维度做一轮交叉比对最后汇总结果。比如先单独检查“标题 参数表”、再单独检查“详情页 主图”、最后汇总时只让模型关注跨组之间的矛盾点。这个策略对长文本体检类的任务非常有效比起一次性做完所有检查分步精细化处理反而更准。4.5 常见问题速查症状可能原因排查思路结果里大量误报提示词中判断规则与例外规则描述不够清楚检查例外规则是否覆盖了所有不应判违规的场景跨文件比对漏检输入文本过长导致模型注意力衰减将比对任务拆分为分组、分维度处理识别出来的表格内容错位Excel 合并单元格处理不当检查 openpyxl 读取策略确认空值填充逻辑模型编造原文没有的内容提示词没有要求引用原文作为判定依据强制要求输出“命中的原文片段”报告问题位置不精确输入文本没有保留页码和段落标记在标准化阶段为每个文本块添加位置标记5. 这套做法的适用范围与延伸方向商品资料包体检助手的应用场景不止于上架前检查顺着这个思路往下走很多电商运营中的体力活都可以自动化。5.1 适用前提迁移成本主要在“规则整理”这套方案能不能在其他品类上直接复用答案是部分可以。极限词库具有通用性但不同品类的合规重点差异很大。食品类目关注质检报告、生产日期和配料表一致性美妆类目关注特殊用途化妆品批准文号数码类目关注 3C 认证和能效标识。迁移到新品类时最费时间的不是改代码而是把品类特有的合规规则整理成结构化描述写进提示词里。所以如果你打算把这个方案落地到自己店铺我建议先花两天时间把目标品类的平台规则通读一遍把高频违规点整理成表格。这份规则表既是提示词的输入来源也可以作为后续人工复核的检查单一举两得。5.2 延伸方向一从“体检”升级为“修复”现在体检助手只是发现问题修改建议也只是文本提示不会自动替换。下一步可以做修复助手模型在发现问题的同时基于原文语义生成修订后的文本。比如检测到标题超长直接给出四个缩略版本运营只需从中选择一个。检测到详情页出现极限词直接替换成合规表述。这能在发现问题的基础上再省掉一半时间。5.3 延伸方向二从“单次检查”升级为“流程节点”现在的模式是一个资料包检查一次。更好的做法是把体检助手嵌入商品管理流程在运营创建商品草稿、编辑详情页、上传资质文件的每个节点都触发一次检查比如标题一保存就立刻检查标题参数表一上传就检查参数表。把问题消灭在产生的那一刻比最后批量检查高效得多。写在最后从有这个想法到真正跑通前后没花多少时间但价值超出预期。以前上架一套商品资料运营人工核对加修改小半天时间肯定要的现在跑一遍体检助手几分钟出结果人力只用花在复核高严重级别问题上就行。这套体验下来最大的感受是大模型的真正价值不是替代人力而是把那些需要“通读全文、交叉比对”的繁琐脑力活接下来人只需要对模型输出的结论做最终把关。如果你手里也有这类反复出现的资料审核工作非常建议拿大模型试一把收获可能比预期大得多。