求职作品 · 方法论文档

AIGC 多模态模型质量评测体系

—— 一线问题观察、方法设计与原型验证

这份东西是什么:我在 AIGC 图像数据一线工作中撞见真实问题后,把"质量评测应该怎么做"系统想了一遍的结果。三层内容,边界先说清:

真实工作经验 我以软件外包身份驻场一家头部 AI 视频生成公司,做图像数据采集、筛选、质量测评和供应商反馈时实际发生的事;

方法论设计 我基于一线经验做的 0→1 评测体系设计,没有经过真实生产批次验证,文中阈值均为待校准初值

个人验证原型 我把想法做成了可点开操作的框架原型,公开在线,谁都可以试;核心评分依赖视觉大模型,公开版没有接入接口、显示的是演示数据,自行接入大模型接口后评分环节才真实工作。

全文标签约定

标签含义
真实经验我在工作中实际做过、发生过的事
方法设计我基于经验设计的机制,未经生产批次验证
原型我做了框架原型验证的部分,附在线链接(公开版为演示数据,接入大模型接口后真实运行)
示例为说明输出形式而虚构的样例数据,不代表真实结果

配套在线原型(两个都是框架原型)

两个在线原型都跑通了完整的产品框架:上传、分析、8 个维度打分、批量报告都能点开操作;但核心评分靠的是视觉大模型,公开版没有接入接口,页面上看到的是演示数据——真要用起来,需要自行接入大模型接口,评分环节才会真实运行。这也是我把它定位成框架原型的原因:流程怎么走、哪一步该谁做、数据怎么流,全部定死了,接上接口就是完整系统。

眼泪物理一致性评测原型 视频物理方向
https://tear-physics-eval.pages.dev
上传视频 → 抽帧 → 人脸识别 → 8 维度物理评分 → 批量报告(公开版为演示数据)
AI 审美官 图像美学方向
https://ai-aesthetic-demo.pages.dev
8 维度美学评估 · 12 种风格动态权重 · 单张分析与批量评分(公开版为演示数据)

01我的起点:问题是在一线撞见的

本章内容全部为真实经验

1.1我每天在干什么

我现在的工作,是以软件外包身份驻场一家头部 AI 视频生成公司,在图像模型团队做美学专员。

日常工作说直白点就是大量看图、判断这张图能不能进模型训练集:AI 图像训练数据的采集、筛选和质量测评,依据项目标准对不同来源的数据做判断,覆盖人像摄影、风景、商业产品、抽象艺术、插画动漫等多个视觉类别;同时参与供应商交付数据的质检,把问题通过具体案例反馈回去。

在工作这段时间里,我撞见的问题不是"某张图画得好不好"——好坏判断我有四年写实绘画训练兜底,秒级能看出画面问题。真正卡住我的是另外三件事。

1.2三个真实的坑

案例 1:一批 1200 张采了一星期,交付当天整批返修

数据生产的链条是这样的:

定方向的人出分类定义 定义一层层往下传到采集端 采集端按定义采图 交付测评端按好坏标准判分

问题在于,采集端开工时手里只有一个分类名称和抽象定义,测评端手里是另一套通用好坏标准,两头在交付那天才第一次碰面

我亲历过一次典型的:采集端一天大约采 200 张,一批 1200 张左右交付,采了整整一星期;交上去测评才发现,风格定义从根上就是错的——很早的时候定义就有问题,但没人发现,整条线一直按这个方向采,交上去判不行,整批退回来重新采。

返修的代价是实打实的:采集按件计费,整批返修意味着供应商白干一星期、项目进度卡住。测评端一天要质检的量是 2000 张量级,等问题在这头暴露,一星期的活已经白干了;而测评端再严格,也只能在一周后发现问题——问题发生在采集第一天,发现却在第七天

案例 2:"二次元厚涂"——一个市场上不存在的采集任务

为什么定义会错?这不是某个人说不清的问题,是链路上缺了一环:采集任务下发之前,没有人对这个风格做过实际调研——这个品类市场上存不存在、长什么样、能采到多少,没人看过,定义就从上一层直接排下来了。

"二次元厚涂"只是最典型的一个,类似拍脑袋的风格化定义还有很多。市场上这个品类基本不存在——厚涂是以平涂为基础、线感较少的"伪厚涂"形式出现的,"二次元形象加写实笔触"的东西几乎找不到。采集端拿着一个不存在的品类硬采,采回来的东西在定义上就不成立——这不是采集员不努力,是前端在没有理解、没有调研的情况下就把任务派下来了。

泡泡玛特采集也是一样:为了覆盖广,定义里设了经典美、类人怪诞、异形几个方向,但同样没有人进到每个分类里实际看过市场——二次元插画里几乎没有"丑"的东西,按"类人怪诞"这种方向数据根本采不齐;而只采拉布布、星星人这类市场爆款,轻轻松松能采到 1200 张达标数据。定义不贴市场,数据量的分配从一开始就是错的。根子是同一个:调研这一步在链路里不存在——这是组织问题,不是技术问题,也不是哪个人审美不行。

案例 3:一套通用标准打所有风格,互相误杀

测评端这边的问题是:所有图片用同一套标准打分。

低饱和的二次元插画,被"色彩鲜艳"这个维度直接判死;CG 商品图本该重质感和造型准确,却被苛求构图色彩。标准本身没错,是用错了地方——人像摄影看重主体表现,素描看重光影结构,抽象艺术看重创意表达,权重不该一样。

结果就是两边对不齐:我们觉得好的数据,供应商全觉得不行;供应商采来的,我们大量打回。"什么是好"这个判断,在传递过程中没有共同语言。

1.3我开始想的事

这三个坑看起来是三件事,我越想越觉得是同一件事:

后端测评再严格,也只能发现问题,不能减少问题。 质量标准如果不能在数据生产的第一天就被采集端理解和执行,返修就是结构性的,不是谁粗心、谁不专业。

而问题的根子是判断力在传递中丢失:定标准的人脑子里的审美判断,传不到采集端;采集端眼里的"好",和测评端对不齐。一层一层传下去,"二次元厚涂"这种不存在的品类也能变成采集任务。

这件事我其实干过一遍。我教过四年高考美术:老师脑子里"什么是好画"的判断,靠嘴讲学生永远 get 不到,但把它拆成范画、每日改画、错题本,基础不同的学生四个月就能稳定达到考试标准。审美判断是可以拆成可执行、可检验的语言的——我在画室里验证过,只是这次要传递的对象从学生变成了采集员、供应商,再往后是模型和系统。

1.4我的第一个尝试:采测同步

我在工作中提过一个想法:能不能采集和测评同时进行。后来在组里做了小范围试点。

做法很简单:

  • 反馈点前移:不等整批交付,小规模试采、当天测评、当天反馈、校准后再加大采集量;
  • 标准前置:采集员开工前就看到这个方向"什么是好数据"的正反例和打分侧重,而不是只拿到一个分类名;
  • 按方向调评估侧重:人像重面部比例与主体表现,CG 重质感与造型准确,风景重构图与光影层次——一套框架,权重随方向走。
试点结果 真实数据:在角色设计小组小批量试点后,相同采集评估时间内,优秀达标数据占比从 30-40% 提升到 80-90%

边界我也说清:这是一个小组的小批量试点,不是全线推广,样本量有限;但它验证了一件事——把反馈点前移、把标准在生产第一天就交出去,达标率是可以大幅提高的,整批返修自然就不会发生

1.5顺着这个尝试,我开始系统想一件事

采测同步解决的是"反馈时点"。但顺着它往下问,问题一串:

  • 好坏标准本身怎么拆,才能让没有美学背景的人也执行得动?(→ 03 美学评测)
  • 图像之外,视频的物理真实性怎么评?"眼泪流得假"这种判断怎么量化?(→ 04 物理评测原型)
  • 人眼看不过来的时候,机器能接哪一段、不能接哪一段?(→ 05 自动化原型)
  • 评测发现的问题,怎么真正变成数据动作和模型迭代,而不是一份打完分就归档的报告?(→ 06 评测驱动迭代)

后面每一章,我都会标清楚:这是我干过的、我设计的、还是我做了原型验证的。没验证过的我不吹成做过,设计了的我也不藏着——我没验证过什么、什么信号出现说明我错了,都写在明处。

02评测是什么:不是打分,是模型迭代的反馈回路

本章为观点与框架设计

先说一个常见误解:评测 = 给模型打个分、排个榜。我在一线打分的体会是,分数本身几乎不产生动作——一张图打 72 还是 78,改变不了下一批数据长什么样。

我理解的评测是一条回路:

业务目标 能力拆解 评测标准 评测数据集 人工打分 质量控制 坏案例归类 问题归因 数据/模型反馈 基准题复测 自动化升级 回到下一轮

两句话说清这条回路:

  1. 评测的目的不是产生一个分数,而是建立"问题发现 → 问题归因 → 数据/模型迭代 → 效果验证"的闭环。 总分留着看趋势——换版本涨跌、整体水平监控看它;但驱动决策的是另外的东西:哪个能力弱、弱在什么变量、该补什么数据。
  2. 总分告诉你"差了",归因告诉你"哪差、补什么"。 一个"手部 2.8 分"不是结论,"手伸向镜头的握持动作好样本缺失"才是结论——后者能直接开出采集任务单(怎么开见 06 章)。

这个框架是我基于一线经验做的方法设计,没有跑过完整批次;但它的每一环在我工作里都能找到对应的痛点:采集与测评脱节(01 章)、标准不统一(03 章)、视频的假怎么抓(04 章)、机器能接哪段(05 章)、坏数据被扔、反馈没有回路(06 章)。

03美学评测:把"感觉不对"拆成看得见的位置

教学经验与一线问题观察为 真实经验;三级能力地图、评分权重、锚点五件套为 方法设计,已在在线原型中部分实现

3.1一个起点:跟人说"感觉不对"没用

我教了四年高考美术,最熟悉的场景是:学生交一张画,你说"这里感觉不对",他下次还是画不对。但你说"光源在左上方,你这个鼻子底面没压下去、缺投影",他立刻能改。

审美判断传递不下去,不是因为审美太玄,是因为判断没有拆到"可观察的位置"。 我在数据一线遇到的是同一个问题的放大版:不同人对同一张图给出不同判断,分歧说不清楚——因为大家争的是"好不好",不是"哪个位置出了什么问题"。

3.2三级能力地图:从总体质量到可观察问题

我把美学评测拆成三级 方法设计

第一级:总体质量——只回答一个问题:这张图能不能用。

第二级:视觉维度——回答"哪方面好/差":

  • 构图:主体位置、画面平衡、空间关系
  • 主体表现:人体结构、面部、动作姿态
  • 光影:光源一致性、明暗关系、材质表现
  • 细节质量:手部、五官、局部结构
  • 风格:风格一致性、色彩、质感

第三级:可观察问题——回答"具体哪个位置、什么东西不对"。

第三级是整套尺子的关键:它不要求判断者有审美,只要求他看得见。 "手部有问题"是审美判断,会吵;"这只手有六根手指"是可观察事实,不用吵。能落到第三级的问题,没有美学背景的人也能判;落不下去的模糊地带,才升级给有审美的人——这也是人机分工的雏形(05 章展开)。

3.3评分标准:固定框架 + 动态权重

每个维度配分档评分标准。以"细节质量-手部"为例 方法设计,分档写法在在线原型里已实现

档位标准(手部要同时看四件事:结构、皮肤、指甲、动作交互)
9-10手指数量、关节、指骨比例全对;皮肤有自然的指节褶皱纹理,指腹与手背质感有区分;指甲形状、位置、透视随手指转;肌腱和手背静脉的阴影合理;握持物体时手指包裹关系、受力点、接触阴影真实
7-8结构大体准确,不细看可以接受;但皮肤偏光滑塑料感,或指甲细节模糊、缺指节纹理;握持关系对但接触阴影不自然
4-6能看出问题:指间关系含糊、有轻微多指感;皮肤质感像塑料或蜡,没有纹理;指甲位置或形状飘;握持时手指和物体的遮挡关系含糊
0-3明确硬伤:手指数量错误、关节反折、手融成一团;或手指和物体穿模、该握住的东西悬在手上

这套尺子不是一张表打天下:同一套维度,不同方向配不同权重。这套设计我在个人原型「AI 审美官」里实现了——8 个维度、12 种风格各有权重配比 原型,在线可试:ai-aesthetic-demo.pages.dev(目前是框架原型,公开版没有接入大模型接口、跑的是演示数据,自行接入视觉大模型接口后即可真实评分)。权重来自我的美术训练和一线评估经验:素描光影权重高,是因为考试评分本身重光影;抽象艺术创意权重高,是因为这类作品的价值核心就是创意。这些权重是我凭经验拍的假设,不是真理——等真实批次数据回来,它们要被验证、被调整。

3.4锚点五件套:文字传不过去的东西,用参照物传

文字评分标准解决"怎么描述",但有些判断文字天生传不到位——什么叫"轻微多指感"?说一百句不如看一张。我在教学里靠范画和错题本解决,迁移到评测就是锚点五件套 方法设计,来自我四年美术教学与一线培训观察,未在生产环境完整验证

锚点作用
5 分标准片这个维度的上限长什么样
3 分边界片"还行但不算好"长什么样——档位分歧最大的地方,必须有锚
1 分坏片下限和致命问题长什么样
易错对比对最容易混的两种判断并排放(真走路 vs 滑步)
条件化反例这个规则什么时候不成立(鱼眼构图不是构图崩坏)

为什么强调 3 分边界片:1 分和 5 分人人都会判,分歧全部发生在中间档。边界片不是教学辅助,是仲裁依据——两个人对一张图吵起来,拿边界片一摆:"这张我们定为 3,你这张比它好还是差?"讨论立刻落地。

这套方法来自我对数据生产中"文字标准难以完全传递视觉判断"的观察,目前是个人方法论设计,没在生产环境完整验证——它在画室里被验证过四年,我相信它换个对象成立,但"相信"和"验证过"是两回事。

3.5案例:手部异常的完整处置链路

把 3.2-3.4 串起来走一个完整案例 真实经验:手部异常是一线最高频的坏案例类别之一处置流程为方法设计

  • 输入:生成图,指令为"人物伸手握持杯子的近景"
  • 人工判断(第三级可观察问题):手指数量异常(六指);指间关系异常(两指融合);关节结构异常(拇指关节反折)
  • 归类:解剖结构错误
  • 严重程度:致命——数量/关节级硬伤(若只是指甲形态瑕疵则算轻微)
  • 处置:否决进当前训练集——但片不删,进失败库,打"手部 × 握持 × 近景"事件标签(接 6.1)
  • 反馈:进入坏案例库的手部失败类,供标准修订和培训引用
  • 后续动作:倒查同类指令——"握持""手伸向镜头""手在脸前"是不是成片出错?如果这一类失败高频出现,就顺着查到数据缺口、开补采任务单(接 6.2)

这张图打 30 分还是 40 分没有意义;"手部 × 握持 × 近景"这个标签组合才有意义——它能被统计、能被归因、能变成下一批采集任务。这就是"评测不为分数"的具体样子。

04视频物理一致性评测:从流泪场景开始做原型

事件判错范式为 方法设计;8 维系统为 个人原型,已上线运行,阈值均为待校准初值

4.1先说边界

我没有生产环境中的视频物理评测经验。 我的一线工作是图像美学,视频物理是我自己选的一个切口做原型验证:人物流泪。

为什么选它:哭泣场景是 AI 视频最容易穿帮的物理现象之一,错误类型集中、肉眼极易识别——眼泪从脸颊中间凭空出现、头都歪了眼泪还垂直往下流、匀速滑动像贴图、漂浮或穿透面部。拿它做第一个切口,问题边界清晰,适合验证"物理判断能不能被结构化"。

4.2为什么视频不能只打总分:事件判错范式

图像美学可以谈"整幅画面的平均质量",视频不行。视频的假是事件:第 3 秒眼泪凭空出现、第 5 秒穿模——是特定时刻、特定位置发生的具体事件,打一个整段平均分,事件就被稀释没了。

所以我用的范式是"事件判错" 方法设计:先定义这个物理现象的事件链,再在每个事件上定眼睛能看见的判错点。流泪的事件链:

哭泣 眼泪产生(起源) 脱离眼眶 沿面部运动 继续滑落 离开画面 / 汇聚滴落

每个事件对应一个判错维度,一共 8 个 原型

维度判什么默认权重
眼泪起源是否从眼角内侧自然涌现,还是脸颊中间凭空出现12%
重力方向 ★头部倾斜时是否沿下坡方向流(头歪了还垂直流 = 最明显穿帮)15%
轨迹连续性泪线是否顺着人脸地形走——泪沟、鼻翼侧沟是自然通道;有没有帧间跳跃、横漂13%
速度变化在鼻侧、下颌线这些陡坡应该加速,在颧骨、面颊凹陷处应该减速滞留;匀速像贴图就是错12%
表面附着 ★是否贴合面部曲面,有无漂浮/穿透15%
泪痕效果流过的路径上要有水痕光泽,沿地形凹陷处停留、自然淡化,而不是整张脸一片油光10%
终点行为下巴滴落/汇聚/蒸发,还是突然消失10%
时间一致性连续帧形态是否稳定13%
这里有个看片时必须带着的画面感:人脸不是平板,是有地形的。 眼泪从内眼角出来后,会被泪沟接住、沿鼻翼两侧往下,在鼻侧陡坡加速,滑过颧骨高处,在面颊凹陷处减速、滞留,最后到下颌线、下巴尖汇聚滴落。流向错(不顺着地形走)、速度错(该慢不慢、该快不快)、附着错(浮在地形表面上)——本质都是泪液和人脸三维结构的关系画错了。

两个标 ★ 的是关键维度,设硬门槛:人脑对重力方向和表面附着的错误最敏感,这两项不达标,其他维度再高也不判合格。这和"美学/物理分数不互相找补"是同一条原则——硬伤不被高分抵掉。这条规则在原型里是真实运行的代码逻辑,不是纸面设计。

4.3阈值不拍脑袋:校准流程

三级合格线(宽松 70 / 中等 75 / 严格 80,关键维度另有门槛)在原型里用着,但我明确标它是 原型参数·待校准——没有真实批次数据之前,任何"超过多少就是错"的数字都是拍的。

我设计的校准流程 方法设计

人工标注一批真实样本 统计各维度得分分布 找正常/异常的自然边界 定出候选阈值 用准确率验证 确定生产阈值

验证看两件事:拦得准不准、漏得多不多。

比如"头部倾斜 15° 时眼泪方向偏差超过多少算错",正确答案不在我脑子里,在人工标注数据的分布里。指标不等于真理——阈值是校准出来的,不是拍脑袋拍出来的。

4.4这个原型证明了什么、没证明什么

原型在线:tear-physics-eval.pages.dev 框架原型——上传、抽帧、人脸识别、打分报告整条流程都在,页面上也标注了"报告为模拟数据、阈值为待校准初值";公开版没有接入视觉大模型接口,看到的评分是演示数据,自行接入接口后评分环节才真实工作。

✓ 证明了

物理直觉可以拆成维度化、可打分、可配置权重的结构化评分标准;关键维度硬门槛、三级合格、批量报告这套产品形态跑得通。

✗ 没证明

评分准不准。8 个维度在真实视频上的打分是否和专家一致,要等真实数据来校准(验证计划见第 7 章)。下一步是眼泪分割与跨帧追踪,让轨迹、速度维度有客观测量,再扩展到布料、流体、碰撞。

05自动化评测:机器接哪一段,人管哪一段

本章为 原型验证:人机分工为 方法设计,流水线已在在线原型中实现

5.1目标不是替代人

自动化评测最容易讲错的一句话是"用机器替代人工"。我给这个原型定的目标是反过来的:验证哪些人工判断可以被机器辅助完成。

分工原则 方法设计

机器适合(不累、稳定、重复一万次不走样)人适合(机器短期接不住)
大规模初筛模棱两可的边界片
轨迹计算、帧间变化检测复杂视觉判断"假不假"
定位异常(第几秒、哪个维度出问题)发现没见过的新问题
统计、汇总、批量报告标准怎么定、阈值划在哪

一句话:机器测机器能量的,人管机器测不了的。

5.2原型流水线怎么跑

原型里的真实链路 原型,在线可看

视频上传 浏览器抽帧(每 2 秒 1 帧) 人脸识别工具标出 468 个关键点 算出头歪多少度、眼睛在哪 挑最多 8 个关键帧 + 头姿数据发给视觉大模型 模型按 8 维评分标准返回结构化评分 汇总成报告

报告含:总分、维度分、关键维度门槛判定、问题帧标记、按严重程度排的改进建议。

在线版本里,抽帧和人脸识别这两步是真实在浏览器里跑的;"发给视觉大模型评分"这一步,公开版没有接入接口,用演示数据占位——流程和接口位置都定死了,接上大模型接口就是完整系统。

这里有个刻意的设计:头歪多少度不是计算机自己拿来打分的,是连同画面一起发给视觉大模型当参考——模型判断"重力方向"时能看到"这一帧头向左倾了 6.6°",判断依据就从"看着像垂直流"变成了"头明明歪了 6.6°,泪迹方向却没跟着偏"——客观测量给主观判断垫了个底。

能力边界我在页面上直接写明,这里也写明:现在这个原型,计算机只认得出人脸、认不出眼泪——轨迹、速度、附着这些维度暂时全靠视觉大模型判断,人脸识别工具只提供头歪多少度。把眼泪单独抠出来、一帧一帧追踪它的位置,是下一步要做的。

5.3比"能跑"更重要的:我知道它会在哪错

原型我刻意不展示"模型又判对了",而是把两类误判摆出来 示例分析,基于原型机制推演

误判 A:该报警的没报(漏报)

  • 场景:眼泪明显横向漂移,但头部姿态数据接近正脸。
  • 系统风险:重力方向分主要参考头姿,视觉模型如果没抓住横移,硬伤维度直接漏报。
  • 为什么危险:重力方向是关键维度、是硬门槛,硬伤漏报比误报严重得多——漏报的坏片会进训练集。
  • 下一步解法:眼泪轨迹必须有独立于头姿的客观测量(眼泪分割 + 跨帧追踪),不能把关键维度全押在模型的主观判断上。

误判 B:不该报的报了(误报)

  • 场景:镜头摇移(摄像机运动),画面里眼泪跟着背景一起横移,眼泪相对人脸其实流得很正常。
  • 系统风险:在画面坐标系里轨迹是斜的,可能被判重力方向错误。
  • 问题根源:动的是镜头,不是眼泪——系统分不清"泪在动"还是"镜头在动"。
  • 解法:先估出镜头怎么动的,或者用头部姿态把镜头运动抵消掉,判断时参照的不是画面,而是脸本身。

这两个误判不是错误清单,是我认为这个原型最有价值的部分:一个评测系统的能力边界,要看它在什么输入下会错。 知道漏报会出现在"计算机测不到、模型没抓住"的维度,就知道该先补哪段工程;知道误报会出现在相机运动场景,就知道真实批次里这类告警必须人工复核。对评测系统来说,知道自己会在哪错,和知道自己能测什么一样重要。

06评测怎么推动迭代

闭环框架为 方法设计;采测同步、水印网图弃用事件为 真实经验;版本对比数字为 示例

评测打完分,然后呢?报告归档、分数上墙,数据还是那些数据——这不算闭环。我理解的闭环是:评测发现的每一类问题,都要有对应的"数据动作",动作的效果在下一轮评测里被看见。 这一章讲两个动作:坏数据怎么处置(6.1),坏案例怎么变成补采和模型迭代(6.2)。

6.1否决不等于删除:坏数据是资产,不是垃圾

先讲我自己一线干过的一件后悔事 真实经验

一线采集时常遇到一类图:从网上找来的素材图,水印很难去除干净。这种图当时我直接弃用——这个判断在当时不算错:去不掉的水印怕被模型学进生成结果。但后来做海报类方向我回过味来:这类图里有一部分,恰恰是海报版式、真实投放场景训练需要的样本。当时的否决有当下的合理性,真正的问题在于"弃用=删掉"——如果只是打标签进冷藏区,海报方向启动时这批样本本来可以直接回捞。

有人问过我一个问题:"垃圾数据也有用,标准太严会不会损失未来的优秀数据?"——我当时就是亲手损失数据的那个人。想清楚之后,我认为根子在于把两件事混成了一件:"不进当前训练集" ≠ "没有价值"。 混为一谈会同时损失两样东西:现在的坏数据本该当模型的反面教材,却被扔了;未来的好数据可能今天就被当垃圾清掉。

我的设计是三个动作 方法设计,未经生产验证

动作一:否决只打标签、换队列,不存在物理删除。

任何关卡的"否决"都是打标签分流,不是删数据。而且一条数据可以同时是"美学池的好片"和"物理池的坏片"——分数不互相找补,也不互相株连:

判定处置
事件级硬伤(穿模、重力反转、多肢体)否决进当前训练集;片不删,进失败库
规律级可疑(形变、流体异常这类非穿帮问题)打事件标签,物理方向降权或不用;美学方向照常可用
当前任务无关但特征稀缺进冷藏区,不删不定性,模型换代后回捞

动作二:坏片一份资产、四次复用。

在这套流程里,坏片库是评测侧最该攒的东西:算法侧消费的是好样本,模型"怎么坏"的记录,主要靠评测一批批攒下来。坏片库同时是四样东西:

复用方向具体用途
失败标本进错误类型库,是分析问题原因的原料(接 03 章手部异常案例的归类逻辑)
培训教材新人仲裁、锚点课的活案例
回归测试题模型发新版本,必须在这些旧坏片上不再犯错,题集只增不减
当反面教材模型要从坏样里学"什么是坏",和好样学"什么是好"同样重要

动作三:删除权上收,一线只分流、不定生死。
采集和标注环节不做数据去留判断。理由很直接:采集人员今天判为"没价值"的,可能只是不符合当下审美,模型能力换代后正是缺口——这批去不掉水印的图就是这么没的。入口只负责打标签分流,真要删数据,必须走集中审批。

这个机制怎么知道没白转 方法设计·验证信号:看三个数——

  • 回捞率:冷藏样本被重新启用的比例。太低说明入库分类太保守、冷藏区变成死档库;太高说明初筛根本没把关;
  • 失败库复用率:坏片被回归测试题、培训教材、反面教材至少引用一次的比例。只存不用的坏片库没有存在意义;
  • 任务单转化率:评测开出的采集补采任务单,实际交付并通过验收的比例(接 6.2)。

这一节的落点和 02 章那句话呼应:坏数据里存着模型最该学的东西,扔坏数据等于扔掉教材。

6.2负样本是迭代的起点:从"哪里坏了"到"补什么数据"

我先说我理解的迭代顺序,因为它和直觉是反的:

不是先有完美的训练集、模型跑出来都好;而是模型先在一堆样本上出错——这些出错的负样本被看见、被归类,我们才知道自己哪里不足、问题在哪。负样本不是迭代结束后归档的垃圾,是迭代启动的第一个信号。

这和 6.1 是同一件事的两面:6.1 讲坏数据"存下来别扔",这一节讲坏数据"怎么推动下一步"。链路我设计成这样 方法设计

第一步:负样本按"怎么坏的"归类,不是按"打了多少分"堆着。

一个手部异常的案例(完整拆解见 03 章案例),打分 60 还是 45 不重要,重要的是它属于哪类失败:手指数量异常、指间关系异常、关节结构异常。归类之后才看得出规律——"手部异常高频"是归因结论,一堆低分不是。

第二步:每一类高频失败,追问到数据缺口。
手部为什么老坏?继续往下问:是不是特定角度(手伸向镜头)、特定手势(握持)、特定遮挡(手在脸前)的好样本训练里就不够?模型没见过,当然生成不出来。归因不能停在"手部差",要落到变量:哪个角度 × 哪个手势 × 什么景别的组合缺数据。

第三步:缺口变成补采任务单,任务单必须能验收。
"多采点手部好图"不是任务单,是形容词。任务单要写清:补什么组合、多少量、质量要求、什么时间。我在一线踩过的坑正好是反面教材——"我想要这个风格化的"这种需求,任务派下来之前没人调研过市场、也没人定义过"好"长什么样,采集端只能按字面理解硬采(详见 01 章泡泡玛特案例)。需求说不清楚,是采集返修最常见的源头之一;任务单必须具体到"看到什么算对"。

第四步:补完数据重训,下一轮评测拿同一批负样本当考题。
这就是 6.1 里回归测试题的用法:这批手部坏片,V2 模型必须在上面不再犯错。旧负样本同时是验收新模型的标尺——补采有没有用,数据自己说话。

第五步:分数没回升,说明归因错了,任务单打回重来。
闭环最容易断的地方在这:就算补了 200 条手部好样本,V2 手部分数没动——那就不是数据量的问题,可能是手和脸同时出现时模型注意力分配的问题,该往模型侧查,而不是继续采。闭环必须带验收,不然就退化成"出问题→采数据→问题还在"的空转。

模型版本之间,迭代有没有真改善,用维度趋势看而不是看总分 示例

维度V1V2变化
构图3.64.1
手部2.83.7↑(补采动作生效)
风格一致性4.04.2→ 持平
物理稳定性2.53.4

(上表数字为说明输出形式的示例,非真实测试结果。)

总分从 3.2 涨到 3.6 不值得高兴——真正值得高兴的是"手部 2.8→3.7"这一格,因为它对应着一轮具体的归因和补采;而风格一致性没动,说明那个方向的数据动作还没排上。评测最终不是为了产生一个漂亮的分数,是为了回答:"模型这一版,到底在哪个能力上真的变好了?"


第 6 章小结:评测驱动迭代靠两个动作——坏数据不删、按标签分流当资产(6.1);坏案例归类、追到数据缺口、补采、用旧负样本验收新模型(6.2)。两个动作合起来才叫闭环:评测发现的每一个问题,都有地方去;每一次补采,都在下一轮评测里被验证。 这也是我在一线最缺的东西——我能看见问题、能反馈问题,但反馈之后"问题去哪了、修没修、修得对不对",没有渠道看见。这套设计想补的就是这个断点。

07诚实清单:这套东西现在到哪一步了

本章全部为现状说明,不含已完成的验证

7.1我现在证明不了什么

说清楚:这套体系目前没有经过任何真实生产批次检验。没有团队跑过、没有真实数据回流、连最基础的打分一致性都还没测出数字——它是我基于一线工作经验、对现有组织方式的观察和一些专业理解做出的预判,不是结论。

但"将来怎么验证它"我是想过的。一个评测系统不能只给别人打分、自己不被检验。我设计了五关,每关打算怎么测、现在什么状态,如实摆出来:

检验回答什么问题打算怎么测现在的状态
一致性不同的人打分能不能打到一块找有审美背景的人背靠背独立打同一批图,算一致率(Kappa)15 张测试图和打分表已经做好,人还没约到,没有数据
准确性自动打分和专家判断对不对得上自动结果对照专家判定,看错拦多不多、漏拦多不多测不了:需要真实视频批次,我现在没有
稳定性同一个视频反复测,分数抖不抖同样的视频测多次,看分数波动测不了:演示版用的是固定演示数据
敏感性模型出明显硬伤时抓不抓得到已知坏片喂进去,看对应维度会不会拉响机制上留了(关键维度硬门槛),没量化过
区分度好模型和差模型能不能拉开分拿不同水平的生成结果测,看分数能不能分开测不了:需要多来源、多水平的视频

第一关我打算先过一致性,顺序是我想清楚的:如果连有审美背景的人之间对同一批图都判不一致,那是标准本身没写稳,该回去改评分标准,而不是急着推广、急着上自动化。先证明尺子量得准,再谈用尺子量别人。

7.2我现在会什么、不会什么

已经在干的 真实经验正在做、还没验证的 方法设计 原型暂时不会的 诚实清单
AIGC 图像数据采集与筛选结构化美学评分标准 + 锚点五件套生产级自动化流水线
图像质量判断与美学问题识别视频物理评测(眼泪原型已上线)大规模评测系统建设
坏案例分类整理与反馈人机分工设计模型训练与算法实现
供应商质量反馈阈值校准方法数据库与评测平台工程
采测同步小批量试点(达标率 30-40%→80-90%)打分一致性实测(图和表备好,人没约到)视频方向的真实生产批次
四年审美标准化教学两个能跑的在线原型(审美官 / 眼泪)更深入的计算机视觉算法

右边两栏我不回避:一栏是"我设计了但没验证",一栏是"我暂时不会"。写这份文档不是为了证明我已经是评测负责人,而是展示一件事:一个在一线真实撞见问题的人,怎么把问题拆成结构化的解法,并且动手把能验证的部分先做成了原型。