AIGC 多模态模型质量评测体系
—— 一线问题观察、方法设计与原型验证
这份东西是什么:我在 AIGC 图像数据一线工作中撞见真实问题后,把"质量评测应该怎么做"系统想了一遍的结果。三层内容,边界先说清:
真实工作经验 我以软件外包身份驻场一家头部 AI 视频生成公司,做图像数据采集、筛选、质量测评和供应商反馈时实际发生的事;
方法论设计 我基于一线经验做的 0→1 评测体系设计,没有经过真实生产批次验证,文中阈值均为待校准初值;
个人验证原型 我把想法做成了可点开操作的框架原型,公开在线,谁都可以试;核心评分依赖视觉大模型,公开版没有接入接口、显示的是演示数据,自行接入大模型接口后评分环节才真实工作。
全文标签约定
| 标签 | 含义 |
|---|---|
| 真实经验 | 我在工作中实际做过、发生过的事 |
| 方法设计 | 我基于经验设计的机制,未经生产批次验证 |
| 原型 | 我做了框架原型验证的部分,附在线链接(公开版为演示数据,接入大模型接口后真实运行) |
| 示例 | 为说明输出形式而虚构的样例数据,不代表真实结果 |
配套在线原型(两个都是框架原型)
两个在线原型都跑通了完整的产品框架:上传、分析、8 个维度打分、批量报告都能点开操作;但核心评分靠的是视觉大模型,公开版没有接入接口,页面上看到的是演示数据——真要用起来,需要自行接入大模型接口,评分环节才会真实运行。这也是我把它定位成框架原型的原因:流程怎么走、哪一步该谁做、数据怎么流,全部定死了,接上接口就是完整系统。
01我的起点:问题是在一线撞见的
1.1我每天在干什么
我现在的工作,是以软件外包身份驻场一家头部 AI 视频生成公司,在图像模型团队做美学专员。
日常工作说直白点就是大量看图、判断这张图能不能进模型训练集:AI 图像训练数据的采集、筛选和质量测评,依据项目标准对不同来源的数据做判断,覆盖人像摄影、风景、商业产品、抽象艺术、插画动漫等多个视觉类别;同时参与供应商交付数据的质检,把问题通过具体案例反馈回去。
在工作这段时间里,我撞见的问题不是"某张图画得好不好"——好坏判断我有四年写实绘画训练兜底,秒级能看出画面问题。真正卡住我的是另外三件事。
1.2三个真实的坑
案例 1:一批 1200 张采了一星期,交付当天整批返修
数据生产的链条是这样的:
问题在于,采集端开工时手里只有一个分类名称和抽象定义,测评端手里是另一套通用好坏标准,两头在交付那天才第一次碰面。
我亲历过一次典型的:采集端一天大约采 200 张,一批 1200 张左右交付,采了整整一星期;交上去测评才发现,风格定义从根上就是错的——很早的时候定义就有问题,但没人发现,整条线一直按这个方向采,交上去判不行,整批退回来重新采。
返修的代价是实打实的:采集按件计费,整批返修意味着供应商白干一星期、项目进度卡住。测评端一天要质检的量是 2000 张量级,等问题在这头暴露,一星期的活已经白干了;而测评端再严格,也只能在一周后发现问题——问题发生在采集第一天,发现却在第七天。
案例 2:"二次元厚涂"——一个市场上不存在的采集任务
为什么定义会错?这不是某个人说不清的问题,是链路上缺了一环:采集任务下发之前,没有人对这个风格做过实际调研——这个品类市场上存不存在、长什么样、能采到多少,没人看过,定义就从上一层直接排下来了。
"二次元厚涂"只是最典型的一个,类似拍脑袋的风格化定义还有很多。市场上这个品类基本不存在——厚涂是以平涂为基础、线感较少的"伪厚涂"形式出现的,"二次元形象加写实笔触"的东西几乎找不到。采集端拿着一个不存在的品类硬采,采回来的东西在定义上就不成立——这不是采集员不努力,是前端在没有理解、没有调研的情况下就把任务派下来了。
泡泡玛特采集也是一样:为了覆盖广,定义里设了经典美、类人怪诞、异形几个方向,但同样没有人进到每个分类里实际看过市场——二次元插画里几乎没有"丑"的东西,按"类人怪诞"这种方向数据根本采不齐;而只采拉布布、星星人这类市场爆款,轻轻松松能采到 1200 张达标数据。定义不贴市场,数据量的分配从一开始就是错的。根子是同一个:调研这一步在链路里不存在——这是组织问题,不是技术问题,也不是哪个人审美不行。
案例 3:一套通用标准打所有风格,互相误杀
测评端这边的问题是:所有图片用同一套标准打分。
低饱和的二次元插画,被"色彩鲜艳"这个维度直接判死;CG 商品图本该重质感和造型准确,却被苛求构图色彩。标准本身没错,是用错了地方——人像摄影看重主体表现,素描看重光影结构,抽象艺术看重创意表达,权重不该一样。
结果就是两边对不齐:我们觉得好的数据,供应商全觉得不行;供应商采来的,我们大量打回。"什么是好"这个判断,在传递过程中没有共同语言。
1.3我开始想的事
这三个坑看起来是三件事,我越想越觉得是同一件事:
后端测评再严格,也只能发现问题,不能减少问题。 质量标准如果不能在数据生产的第一天就被采集端理解和执行,返修就是结构性的,不是谁粗心、谁不专业。
而问题的根子是判断力在传递中丢失:定标准的人脑子里的审美判断,传不到采集端;采集端眼里的"好",和测评端对不齐。一层一层传下去,"二次元厚涂"这种不存在的品类也能变成采集任务。
这件事我其实干过一遍。我教过四年高考美术:老师脑子里"什么是好画"的判断,靠嘴讲学生永远 get 不到,但把它拆成范画、每日改画、错题本,基础不同的学生四个月就能稳定达到考试标准。审美判断是可以拆成可执行、可检验的语言的——我在画室里验证过,只是这次要传递的对象从学生变成了采集员、供应商,再往后是模型和系统。
1.4我的第一个尝试:采测同步
我在工作中提过一个想法:能不能采集和测评同时进行。后来在组里做了小范围试点。
做法很简单:
- 反馈点前移:不等整批交付,小规模试采、当天测评、当天反馈、校准后再加大采集量;
- 标准前置:采集员开工前就看到这个方向"什么是好数据"的正反例和打分侧重,而不是只拿到一个分类名;
- 按方向调评估侧重:人像重面部比例与主体表现,CG 重质感与造型准确,风景重构图与光影层次——一套框架,权重随方向走。
边界我也说清:这是一个小组的小批量试点,不是全线推广,样本量有限;但它验证了一件事——把反馈点前移、把标准在生产第一天就交出去,达标率是可以大幅提高的,整批返修自然就不会发生。
1.5顺着这个尝试,我开始系统想一件事
采测同步解决的是"反馈时点"。但顺着它往下问,问题一串:
- 好坏标准本身怎么拆,才能让没有美学背景的人也执行得动?(→ 03 美学评测)
- 图像之外,视频的物理真实性怎么评?"眼泪流得假"这种判断怎么量化?(→ 04 物理评测原型)
- 人眼看不过来的时候,机器能接哪一段、不能接哪一段?(→ 05 自动化原型)
- 评测发现的问题,怎么真正变成数据动作和模型迭代,而不是一份打完分就归档的报告?(→ 06 评测驱动迭代)
后面每一章,我都会标清楚:这是我干过的、我设计的、还是我做了原型验证的。没验证过的我不吹成做过,设计了的我也不藏着——我没验证过什么、什么信号出现说明我错了,都写在明处。
02评测是什么:不是打分,是模型迭代的反馈回路
先说一个常见误解:评测 = 给模型打个分、排个榜。我在一线打分的体会是,分数本身几乎不产生动作——一张图打 72 还是 78,改变不了下一批数据长什么样。
我理解的评测是一条回路:
两句话说清这条回路:
- 评测的目的不是产生一个分数,而是建立"问题发现 → 问题归因 → 数据/模型迭代 → 效果验证"的闭环。 总分留着看趋势——换版本涨跌、整体水平监控看它;但驱动决策的是另外的东西:哪个能力弱、弱在什么变量、该补什么数据。
- 总分告诉你"差了",归因告诉你"哪差、补什么"。 一个"手部 2.8 分"不是结论,"手伸向镜头的握持动作好样本缺失"才是结论——后者能直接开出采集任务单(怎么开见 06 章)。
这个框架是我基于一线经验做的方法设计,没有跑过完整批次;但它的每一环在我工作里都能找到对应的痛点:采集与测评脱节(01 章)、标准不统一(03 章)、视频的假怎么抓(04 章)、机器能接哪段(05 章)、坏数据被扔、反馈没有回路(06 章)。
03美学评测:把"感觉不对"拆成看得见的位置
3.1一个起点:跟人说"感觉不对"没用
我教了四年高考美术,最熟悉的场景是:学生交一张画,你说"这里感觉不对",他下次还是画不对。但你说"光源在左上方,你这个鼻子底面没压下去、缺投影",他立刻能改。
审美判断传递不下去,不是因为审美太玄,是因为判断没有拆到"可观察的位置"。 我在数据一线遇到的是同一个问题的放大版:不同人对同一张图给出不同判断,分歧说不清楚——因为大家争的是"好不好",不是"哪个位置出了什么问题"。
3.2三级能力地图:从总体质量到可观察问题
我把美学评测拆成三级 方法设计:
第一级:总体质量——只回答一个问题:这张图能不能用。
第二级:视觉维度——回答"哪方面好/差":
- 构图:主体位置、画面平衡、空间关系
- 主体表现:人体结构、面部、动作姿态
- 光影:光源一致性、明暗关系、材质表现
- 细节质量:手部、五官、局部结构
- 风格:风格一致性、色彩、质感
第三级:可观察问题——回答"具体哪个位置、什么东西不对"。
第三级是整套尺子的关键:它不要求判断者有审美,只要求他看得见。 "手部有问题"是审美判断,会吵;"这只手有六根手指"是可观察事实,不用吵。能落到第三级的问题,没有美学背景的人也能判;落不下去的模糊地带,才升级给有审美的人——这也是人机分工的雏形(05 章展开)。
3.3评分标准:固定框架 + 动态权重
每个维度配分档评分标准。以"细节质量-手部"为例 方法设计,分档写法在在线原型里已实现:
| 档位 | 标准(手部要同时看四件事:结构、皮肤、指甲、动作交互) |
|---|---|
| 9-10 | 手指数量、关节、指骨比例全对;皮肤有自然的指节褶皱纹理,指腹与手背质感有区分;指甲形状、位置、透视随手指转;肌腱和手背静脉的阴影合理;握持物体时手指包裹关系、受力点、接触阴影真实 |
| 7-8 | 结构大体准确,不细看可以接受;但皮肤偏光滑塑料感,或指甲细节模糊、缺指节纹理;握持关系对但接触阴影不自然 |
| 4-6 | 能看出问题:指间关系含糊、有轻微多指感;皮肤质感像塑料或蜡,没有纹理;指甲位置或形状飘;握持时手指和物体的遮挡关系含糊 |
| 0-3 | 明确硬伤:手指数量错误、关节反折、手融成一团;或手指和物体穿模、该握住的东西悬在手上 |
这套尺子不是一张表打天下:同一套维度,不同方向配不同权重。这套设计我在个人原型「AI 审美官」里实现了——8 个维度、12 种风格各有权重配比 原型,在线可试:ai-aesthetic-demo.pages.dev(目前是框架原型,公开版没有接入大模型接口、跑的是演示数据,自行接入视觉大模型接口后即可真实评分)。权重来自我的美术训练和一线评估经验:素描光影权重高,是因为考试评分本身重光影;抽象艺术创意权重高,是因为这类作品的价值核心就是创意。这些权重是我凭经验拍的假设,不是真理——等真实批次数据回来,它们要被验证、被调整。
3.4锚点五件套:文字传不过去的东西,用参照物传
文字评分标准解决"怎么描述",但有些判断文字天生传不到位——什么叫"轻微多指感"?说一百句不如看一张。我在教学里靠范画和错题本解决,迁移到评测就是锚点五件套 方法设计,来自我四年美术教学与一线培训观察,未在生产环境完整验证:
| 锚点 | 作用 |
|---|---|
| 5 分标准片 | 这个维度的上限长什么样 |
| 3 分边界片 | "还行但不算好"长什么样——档位分歧最大的地方,必须有锚 |
| 1 分坏片 | 下限和致命问题长什么样 |
| 易错对比对 | 最容易混的两种判断并排放(真走路 vs 滑步) |
| 条件化反例 | 这个规则什么时候不成立(鱼眼构图不是构图崩坏) |
为什么强调 3 分边界片:1 分和 5 分人人都会判,分歧全部发生在中间档。边界片不是教学辅助,是仲裁依据——两个人对一张图吵起来,拿边界片一摆:"这张我们定为 3,你这张比它好还是差?"讨论立刻落地。
这套方法来自我对数据生产中"文字标准难以完全传递视觉判断"的观察,目前是个人方法论设计,没在生产环境完整验证——它在画室里被验证过四年,我相信它换个对象成立,但"相信"和"验证过"是两回事。
3.5案例:手部异常的完整处置链路
把 3.2-3.4 串起来走一个完整案例 真实经验:手部异常是一线最高频的坏案例类别之一处置流程为方法设计:
- 输入:生成图,指令为"人物伸手握持杯子的近景"
- 人工判断(第三级可观察问题):手指数量异常(六指);指间关系异常(两指融合);关节结构异常(拇指关节反折)
- 归类:解剖结构错误
- 严重程度:致命——数量/关节级硬伤(若只是指甲形态瑕疵则算轻微)
- 处置:否决进当前训练集——但片不删,进失败库,打"手部 × 握持 × 近景"事件标签(接 6.1)
- 反馈:进入坏案例库的手部失败类,供标准修订和培训引用
- 后续动作:倒查同类指令——"握持""手伸向镜头""手在脸前"是不是成片出错?如果这一类失败高频出现,就顺着查到数据缺口、开补采任务单(接 6.2)
这张图打 30 分还是 40 分没有意义;"手部 × 握持 × 近景"这个标签组合才有意义——它能被统计、能被归因、能变成下一批采集任务。这就是"评测不为分数"的具体样子。
04视频物理一致性评测:从流泪场景开始做原型
4.1先说边界
我没有生产环境中的视频物理评测经验。 我的一线工作是图像美学,视频物理是我自己选的一个切口做原型验证:人物流泪。
为什么选它:哭泣场景是 AI 视频最容易穿帮的物理现象之一,错误类型集中、肉眼极易识别——眼泪从脸颊中间凭空出现、头都歪了眼泪还垂直往下流、匀速滑动像贴图、漂浮或穿透面部。拿它做第一个切口,问题边界清晰,适合验证"物理判断能不能被结构化"。
4.2为什么视频不能只打总分:事件判错范式
图像美学可以谈"整幅画面的平均质量",视频不行。视频的假是事件:第 3 秒眼泪凭空出现、第 5 秒穿模——是特定时刻、特定位置发生的具体事件,打一个整段平均分,事件就被稀释没了。
所以我用的范式是"事件判错" 方法设计:先定义这个物理现象的事件链,再在每个事件上定眼睛能看见的判错点。流泪的事件链:
每个事件对应一个判错维度,一共 8 个 原型:
| 维度 | 判什么 | 默认权重 |
|---|---|---|
| 眼泪起源 | 是否从眼角内侧自然涌现,还是脸颊中间凭空出现 | 12% |
| 重力方向 ★ | 头部倾斜时是否沿下坡方向流(头歪了还垂直流 = 最明显穿帮) | 15% |
| 轨迹连续性 | 泪线是否顺着人脸地形走——泪沟、鼻翼侧沟是自然通道;有没有帧间跳跃、横漂 | 13% |
| 速度变化 | 在鼻侧、下颌线这些陡坡应该加速,在颧骨、面颊凹陷处应该减速滞留;匀速像贴图就是错 | 12% |
| 表面附着 ★ | 是否贴合面部曲面,有无漂浮/穿透 | 15% |
| 泪痕效果 | 流过的路径上要有水痕光泽,沿地形凹陷处停留、自然淡化,而不是整张脸一片油光 | 10% |
| 终点行为 | 下巴滴落/汇聚/蒸发,还是突然消失 | 10% |
| 时间一致性 | 连续帧形态是否稳定 | 13% |
两个标 ★ 的是关键维度,设硬门槛:人脑对重力方向和表面附着的错误最敏感,这两项不达标,其他维度再高也不判合格。这和"美学/物理分数不互相找补"是同一条原则——硬伤不被高分抵掉。这条规则在原型里是真实运行的代码逻辑,不是纸面设计。
4.3阈值不拍脑袋:校准流程
三级合格线(宽松 70 / 中等 75 / 严格 80,关键维度另有门槛)在原型里用着,但我明确标它是 原型参数·待校准——没有真实批次数据之前,任何"超过多少就是错"的数字都是拍的。
我设计的校准流程 方法设计:
验证看两件事:拦得准不准、漏得多不多。
比如"头部倾斜 15° 时眼泪方向偏差超过多少算错",正确答案不在我脑子里,在人工标注数据的分布里。指标不等于真理——阈值是校准出来的,不是拍脑袋拍出来的。
4.4这个原型证明了什么、没证明什么
原型在线:tear-physics-eval.pages.dev 框架原型——上传、抽帧、人脸识别、打分报告整条流程都在,页面上也标注了"报告为模拟数据、阈值为待校准初值";公开版没有接入视觉大模型接口,看到的评分是演示数据,自行接入接口后评分环节才真实工作。
✓ 证明了
物理直觉可以拆成维度化、可打分、可配置权重的结构化评分标准;关键维度硬门槛、三级合格、批量报告这套产品形态跑得通。
✗ 没证明
评分准不准。8 个维度在真实视频上的打分是否和专家一致,要等真实数据来校准(验证计划见第 7 章)。下一步是眼泪分割与跨帧追踪,让轨迹、速度维度有客观测量,再扩展到布料、流体、碰撞。
05自动化评测:机器接哪一段,人管哪一段
5.1目标不是替代人
自动化评测最容易讲错的一句话是"用机器替代人工"。我给这个原型定的目标是反过来的:验证哪些人工判断可以被机器辅助完成。
分工原则 方法设计:
| 机器适合(不累、稳定、重复一万次不走样) | 人适合(机器短期接不住) |
|---|---|
| 大规模初筛 | 模棱两可的边界片 |
| 轨迹计算、帧间变化检测 | 复杂视觉判断"假不假" |
| 定位异常(第几秒、哪个维度出问题) | 发现没见过的新问题 |
| 统计、汇总、批量报告 | 标准怎么定、阈值划在哪 |
一句话:机器测机器能量的,人管机器测不了的。
5.2原型流水线怎么跑
原型里的真实链路 原型,在线可看:
报告含:总分、维度分、关键维度门槛判定、问题帧标记、按严重程度排的改进建议。
在线版本里,抽帧和人脸识别这两步是真实在浏览器里跑的;"发给视觉大模型评分"这一步,公开版没有接入接口,用演示数据占位——流程和接口位置都定死了,接上大模型接口就是完整系统。
这里有个刻意的设计:头歪多少度不是计算机自己拿来打分的,是连同画面一起发给视觉大模型当参考——模型判断"重力方向"时能看到"这一帧头向左倾了 6.6°",判断依据就从"看着像垂直流"变成了"头明明歪了 6.6°,泪迹方向却没跟着偏"——客观测量给主观判断垫了个底。
能力边界我在页面上直接写明,这里也写明:现在这个原型,计算机只认得出人脸、认不出眼泪——轨迹、速度、附着这些维度暂时全靠视觉大模型判断,人脸识别工具只提供头歪多少度。把眼泪单独抠出来、一帧一帧追踪它的位置,是下一步要做的。
5.3比"能跑"更重要的:我知道它会在哪错
原型我刻意不展示"模型又判对了",而是把两类误判摆出来 示例分析,基于原型机制推演:
误判 A:该报警的没报(漏报)
- 场景:眼泪明显横向漂移,但头部姿态数据接近正脸。
- 系统风险:重力方向分主要参考头姿,视觉模型如果没抓住横移,硬伤维度直接漏报。
- 为什么危险:重力方向是关键维度、是硬门槛,硬伤漏报比误报严重得多——漏报的坏片会进训练集。
- 下一步解法:眼泪轨迹必须有独立于头姿的客观测量(眼泪分割 + 跨帧追踪),不能把关键维度全押在模型的主观判断上。
误判 B:不该报的报了(误报)
- 场景:镜头摇移(摄像机运动),画面里眼泪跟着背景一起横移,眼泪相对人脸其实流得很正常。
- 系统风险:在画面坐标系里轨迹是斜的,可能被判重力方向错误。
- 问题根源:动的是镜头,不是眼泪——系统分不清"泪在动"还是"镜头在动"。
- 解法:先估出镜头怎么动的,或者用头部姿态把镜头运动抵消掉,判断时参照的不是画面,而是脸本身。
这两个误判不是错误清单,是我认为这个原型最有价值的部分:一个评测系统的能力边界,要看它在什么输入下会错。 知道漏报会出现在"计算机测不到、模型没抓住"的维度,就知道该先补哪段工程;知道误报会出现在相机运动场景,就知道真实批次里这类告警必须人工复核。对评测系统来说,知道自己会在哪错,和知道自己能测什么一样重要。
06评测怎么推动迭代
评测打完分,然后呢?报告归档、分数上墙,数据还是那些数据——这不算闭环。我理解的闭环是:评测发现的每一类问题,都要有对应的"数据动作",动作的效果在下一轮评测里被看见。 这一章讲两个动作:坏数据怎么处置(6.1),坏案例怎么变成补采和模型迭代(6.2)。
6.1否决不等于删除:坏数据是资产,不是垃圾
先讲我自己一线干过的一件后悔事 真实经验。
一线采集时常遇到一类图:从网上找来的素材图,水印很难去除干净。这种图当时我直接弃用——这个判断在当时不算错:去不掉的水印怕被模型学进生成结果。但后来做海报类方向我回过味来:这类图里有一部分,恰恰是海报版式、真实投放场景训练需要的样本。当时的否决有当下的合理性,真正的问题在于"弃用=删掉"——如果只是打标签进冷藏区,海报方向启动时这批样本本来可以直接回捞。
有人问过我一个问题:"垃圾数据也有用,标准太严会不会损失未来的优秀数据?"——我当时就是亲手损失数据的那个人。想清楚之后,我认为根子在于把两件事混成了一件:"不进当前训练集" ≠ "没有价值"。 混为一谈会同时损失两样东西:现在的坏数据本该当模型的反面教材,却被扔了;未来的好数据可能今天就被当垃圾清掉。
我的设计是三个动作 方法设计,未经生产验证:
动作一:否决只打标签、换队列,不存在物理删除。
任何关卡的"否决"都是打标签分流,不是删数据。而且一条数据可以同时是"美学池的好片"和"物理池的坏片"——分数不互相找补,也不互相株连:
| 判定 | 处置 |
|---|---|
| 事件级硬伤(穿模、重力反转、多肢体) | 否决进当前训练集;片不删,进失败库 |
| 规律级可疑(形变、流体异常这类非穿帮问题) | 打事件标签,物理方向降权或不用;美学方向照常可用 |
| 当前任务无关但特征稀缺 | 进冷藏区,不删不定性,模型换代后回捞 |
动作二:坏片一份资产、四次复用。
在这套流程里,坏片库是评测侧最该攒的东西:算法侧消费的是好样本,模型"怎么坏"的记录,主要靠评测一批批攒下来。坏片库同时是四样东西:
| 复用方向 | 具体用途 |
|---|---|
| 失败标本 | 进错误类型库,是分析问题原因的原料(接 03 章手部异常案例的归类逻辑) |
| 培训教材 | 新人仲裁、锚点课的活案例 |
| 回归测试题 | 模型发新版本,必须在这些旧坏片上不再犯错,题集只增不减 |
| 当反面教材 | 模型要从坏样里学"什么是坏",和好样学"什么是好"同样重要 |
动作三:删除权上收,一线只分流、不定生死。
采集和标注环节不做数据去留判断。理由很直接:采集人员今天判为"没价值"的,可能只是不符合当下审美,模型能力换代后正是缺口——这批去不掉水印的图就是这么没的。入口只负责打标签分流,真要删数据,必须走集中审批。
这个机制怎么知道没白转 方法设计·验证信号:看三个数——
- 回捞率:冷藏样本被重新启用的比例。太低说明入库分类太保守、冷藏区变成死档库;太高说明初筛根本没把关;
- 失败库复用率:坏片被回归测试题、培训教材、反面教材至少引用一次的比例。只存不用的坏片库没有存在意义;
- 任务单转化率:评测开出的采集补采任务单,实际交付并通过验收的比例(接 6.2)。
这一节的落点和 02 章那句话呼应:坏数据里存着模型最该学的东西,扔坏数据等于扔掉教材。
6.2负样本是迭代的起点:从"哪里坏了"到"补什么数据"
我先说我理解的迭代顺序,因为它和直觉是反的:
这和 6.1 是同一件事的两面:6.1 讲坏数据"存下来别扔",这一节讲坏数据"怎么推动下一步"。链路我设计成这样 方法设计:
第一步:负样本按"怎么坏的"归类,不是按"打了多少分"堆着。
一个手部异常的案例(完整拆解见 03 章案例),打分 60 还是 45 不重要,重要的是它属于哪类失败:手指数量异常、指间关系异常、关节结构异常。归类之后才看得出规律——"手部异常高频"是归因结论,一堆低分不是。
第二步:每一类高频失败,追问到数据缺口。
手部为什么老坏?继续往下问:是不是特定角度(手伸向镜头)、特定手势(握持)、特定遮挡(手在脸前)的好样本训练里就不够?模型没见过,当然生成不出来。归因不能停在"手部差",要落到变量:哪个角度 × 哪个手势 × 什么景别的组合缺数据。
第三步:缺口变成补采任务单,任务单必须能验收。
"多采点手部好图"不是任务单,是形容词。任务单要写清:补什么组合、多少量、质量要求、什么时间。我在一线踩过的坑正好是反面教材——"我想要这个风格化的"这种需求,任务派下来之前没人调研过市场、也没人定义过"好"长什么样,采集端只能按字面理解硬采(详见 01 章泡泡玛特案例)。需求说不清楚,是采集返修最常见的源头之一;任务单必须具体到"看到什么算对"。
第四步:补完数据重训,下一轮评测拿同一批负样本当考题。
这就是 6.1 里回归测试题的用法:这批手部坏片,V2 模型必须在上面不再犯错。旧负样本同时是验收新模型的标尺——补采有没有用,数据自己说话。
第五步:分数没回升,说明归因错了,任务单打回重来。
闭环最容易断的地方在这:就算补了 200 条手部好样本,V2 手部分数没动——那就不是数据量的问题,可能是手和脸同时出现时模型注意力分配的问题,该往模型侧查,而不是继续采。闭环必须带验收,不然就退化成"出问题→采数据→问题还在"的空转。
模型版本之间,迭代有没有真改善,用维度趋势看而不是看总分 示例:
| 维度 | V1 | V2 | 变化 |
|---|---|---|---|
| 构图 | 3.6 | 4.1 | ↑ |
| 手部 | 2.8 | 3.7 | ↑(补采动作生效) |
| 风格一致性 | 4.0 | 4.2 | → 持平 |
| 物理稳定性 | 2.5 | 3.4 | ↑ |
(上表数字为说明输出形式的示例,非真实测试结果。)
总分从 3.2 涨到 3.6 不值得高兴——真正值得高兴的是"手部 2.8→3.7"这一格,因为它对应着一轮具体的归因和补采;而风格一致性没动,说明那个方向的数据动作还没排上。评测最终不是为了产生一个漂亮的分数,是为了回答:"模型这一版,到底在哪个能力上真的变好了?"
第 6 章小结:评测驱动迭代靠两个动作——坏数据不删、按标签分流当资产(6.1);坏案例归类、追到数据缺口、补采、用旧负样本验收新模型(6.2)。两个动作合起来才叫闭环:评测发现的每一个问题,都有地方去;每一次补采,都在下一轮评测里被验证。 这也是我在一线最缺的东西——我能看见问题、能反馈问题,但反馈之后"问题去哪了、修没修、修得对不对",没有渠道看见。这套设计想补的就是这个断点。
07诚实清单:这套东西现在到哪一步了
7.1我现在证明不了什么
说清楚:这套体系目前没有经过任何真实生产批次检验。没有团队跑过、没有真实数据回流、连最基础的打分一致性都还没测出数字——它是我基于一线工作经验、对现有组织方式的观察和一些专业理解做出的预判,不是结论。
但"将来怎么验证它"我是想过的。一个评测系统不能只给别人打分、自己不被检验。我设计了五关,每关打算怎么测、现在什么状态,如实摆出来:
| 检验 | 回答什么问题 | 打算怎么测 | 现在的状态 |
|---|---|---|---|
| 一致性 | 不同的人打分能不能打到一块 | 找有审美背景的人背靠背独立打同一批图,算一致率(Kappa) | 15 张测试图和打分表已经做好,人还没约到,没有数据 |
| 准确性 | 自动打分和专家判断对不对得上 | 自动结果对照专家判定,看错拦多不多、漏拦多不多 | 测不了:需要真实视频批次,我现在没有 |
| 稳定性 | 同一个视频反复测,分数抖不抖 | 同样的视频测多次,看分数波动 | 测不了:演示版用的是固定演示数据 |
| 敏感性 | 模型出明显硬伤时抓不抓得到 | 已知坏片喂进去,看对应维度会不会拉响 | 机制上留了(关键维度硬门槛),没量化过 |
| 区分度 | 好模型和差模型能不能拉开分 | 拿不同水平的生成结果测,看分数能不能分开 | 测不了:需要多来源、多水平的视频 |
第一关我打算先过一致性,顺序是我想清楚的:如果连有审美背景的人之间对同一批图都判不一致,那是标准本身没写稳,该回去改评分标准,而不是急着推广、急着上自动化。先证明尺子量得准,再谈用尺子量别人。
7.2我现在会什么、不会什么
| 已经在干的 真实经验 | 正在做、还没验证的 方法设计 原型 | 暂时不会的 诚实清单 |
|---|---|---|
| AIGC 图像数据采集与筛选 | 结构化美学评分标准 + 锚点五件套 | 生产级自动化流水线 |
| 图像质量判断与美学问题识别 | 视频物理评测(眼泪原型已上线) | 大规模评测系统建设 |
| 坏案例分类整理与反馈 | 人机分工设计 | 模型训练与算法实现 |
| 供应商质量反馈 | 阈值校准方法 | 数据库与评测平台工程 |
| 采测同步小批量试点(达标率 30-40%→80-90%) | 打分一致性实测(图和表备好,人没约到) | 视频方向的真实生产批次 |
| 四年审美标准化教学 | 两个能跑的在线原型(审美官 / 眼泪) | 更深入的计算机视觉算法 |
右边两栏我不回避:一栏是"我设计了但没验证",一栏是"我暂时不会"。写这份文档不是为了证明我已经是评测负责人,而是展示一件事:一个在一线真实撞见问题的人,怎么把问题拆成结构化的解法,并且动手把能验证的部分先做成了原型。