Label Studio 标注一致性(Agreement)计算完整指南:Consensus 与 Pairwise 方法论、指标与权重配置
【免费下载链接】label-studioLabel Studio is a multi-type data labeling and annotation tool with standardized output format项目地址: https://gitcode.com/GitHub_Trending/la/label-studio
导读
本指南以 Label Studio 官方文档《Task agreement》为骨架,系统讲解多标注员场景下"任务一致性/标注共识"(task agreement,即 labeling consensus / annotation consensus)的计算原理与配置方法。你将掌握:在 Data Manager、数据质量看板与成员看板中如何查看一致性分数;Categorical 与 Non-categorical 两类控制标签的差异化评分逻辑;Consensus 与 Pairwise 两种方法论的数学含义、适用场景与选择依据;以及整体一致性权重、逐控制标签指标等高级配置。文末结合仓库源码补充实现层面的证据,帮助你准确评估数据集质量、标注员绩效与模型训练数据的就绪程度。
一、什么是任务一致性(Task Agreement)
在 Label Studio 中,任务一致性(Task Agreement,又称"标注共识"或"标注一致性")衡量的是:多个标注员对同一个任务进行标注时,彼此之间的吻合程度。
一致性分数的价值体现在三个层面:
- 评估数据集质量:高一致性通常意味着标注标准清晰、任务定义明确,数据噪声低;
- 评估模型训练就绪度:只有标注足够一致的训练集,才能为下游机器学习模型提供稳定可靠的监督信号;
- 评估标注员与审核员绩效:通过成员间的一致性矩阵,可以发现个体标注员的偏差、任务指令的歧义以及标注团队的碎片化问题。
Label Studio 针对一致性提供多种可配置的度量方式,帮助从不同角度量化"标注员之间有多一致"。
二、在哪里查看一致性分数
一致性分数在 Label Studio 的多个界面中均有呈现,侧重点各不相同:
| 查看位置 | 展示内容 | 关联文档 |
|---|---|---|
| Data Manager | 每个任务的 per-task 一致性分数、任务级 inter-annotator agreement,以及每个控制标签单独的一致性列 | Agreement columns in the Data Manager |
| 数据质量看板(Data quality dashboard) | 任务一致性分布、按维度(dimension)拆分的一致性、Top 混淆对(confusion pairs)、混淆矩阵 | Data quality dashboard |
| 成员看板(Members dashboard) | 成员与模型的一致性矩阵 | Members dashboard |
注意:成员看板中展示的所有一致性分数均基于Pairwise方法论计算得出。这与 Data Manager 中可配置的全局方法论相互独立。
从前端实现看,Data Manager 的一致性列由 Agreement.jsx 渲染,支持按维度一致性列(dimension_agreement_前缀)展示,并将分数按 <33、33~66、≥66 三档映射为红/黄/绿语义色;后端任务接口则通过precomputed_agreement字段输出 0–100 的一致性分值,如 tasks/api.py 所示。
三、整体一致性 vs 逐控制标签一致性
一致性计算在两个层级上进行:
- Per-control-tag agreement(又称"问题级一致性",question-level agreement)
- Overall agreement(整体一致性)
3.1 逐控制标签一致性(Per-control-tag agreement)
先厘清两个概念:
- Control tags(控制标签):用于对数据进行标注的标签,是标注行为的"产出单元";
- Object tags(对象标签):用于标识待标注数据本身的标签,如
Image、Text、Audio。
例如,若标注配置同时使用RectangleLabels、Choices和Rating对一张图片进行标注,那么该项目就有三个控制标签。
一致性针对每个控制标签分别计算,并且每个控制标签可以独立配置所采用的度量指标(详见 Built-in agreement metrics reference)。在 Data Manager 中,每个控制标签会单独展示一致性列,从而可以直观定位任务的薄弱环节——例如边界框(bounding box)一致性很高,但某个 Choice 字段的一致性很低。
3.2 整体一致性(Overall agreement)
Label Studio 会把各控制标签的分数聚合为一个任务级分数:
- 默认算法:取所有控制标签分数的平均值(mean),这也是未按控制标签过滤时主Agreement列显示的数值;
- 自定义算法:通过为不同控制标签设置权重(weight)来改变整体一致性的计算方式,使关键控制标签对整体分数拥有更大的影响力(详见下文 六、3 配置整体一致性权重)。
四、Categorical 与 Non-categorical 控制标签
一致性的计算方式在分类(categorical)控制标签与非分类(non-categorical)控制标签之间有着本质差异——它同时影响结果抽取(extraction)、比较指标(comparison metrics)以及计分方式(scoring)。
4.1 Categorical 控制标签
分类控制标签产生离散、有限的值,标注员从定义好的选项集合中挑选。
典型示例:
- Choices(如 "Small"、"Medium"、"Large")
- Rating(如 1–5 星)
由于分类值是离散的,默认采用精确匹配(Exact Match):两个值要么匹配(分数 =1.0),要么不匹配(分数 =0.0)。
不过,Rating、Number这类标签还可以改用Numeric Difference with Threshold:通过定义允许的数值偏差来判定匹配,例如阈值为0意味着只有完全相同的评分才算匹配。
分类比较天然产生二值分数(0或1),因此与两种方法论均能直接配合:
- Pairwise Average:对标注员两两组合的 0/1 分数取平均;
- Consensus:由于分数本身已是二值,无需阈值转换,Consensus 方法天然反映多数一致。
4.2 Non-categorical 控制标签
非分类控制标签产生空间、几何或结构化数据,标注员需要绘制区域、高亮文本片段或摆放元素位置。
典型示例:
- RectangleLabels(目标周围的边界框)
- Labels(文本片段 / NER 标注)
- PolygonLabels、EllipseLabels、KeyPointLabels等
由于两个标注员几乎不可能画出完全相同的区域,系统使用连续相似度指标衡量重叠程度,例如:
- IoU(Intersection over Union):用于边界框和多边形,返回
0.0(无重叠)到1.0(完全重叠)之间的浮点数; - Span Overlap:用于文本片段,衡量两个高亮文本区域的重叠程度。
4.3 差异一览表
| 维度 | Categorical 标签 | Non-Categorical 标签 |
|---|---|---|
| 输出类型 | 离散值(标签、评分) | 空间/结构化数据(框、片段) |
| 典型指标 | Exact Match、Numeric Difference | IoU、Span Overlap |
| 分数类型 | 二值(0或1) | 连续(0.0到1.0) |
| Pairwise | 直接可用;对二值分数取平均 | 直接可用;对连续分数取平均 |
| Consensus | 直接可用;无需阈值 | 需要用户定义阈值先将分数二值化 |
五、方法论(Methodology)
方法论可在Settings > Quality > Agreement区域按项目进行配置,提供两种选择:
- Consensus(共识):衡量"有多大百分比的标注员选择了最常见的答案?"
- Pairwise(两两):衡量"所有标注员两两组合的平均一致性分数是多少?"
提示:你可以在任意时刻切换方法论。
5.1 Consensus
Consensus 一次性考察全部标注员,衡量他们整体上向某个共同答案收敛的程度。它有两种等价的观察视角:
- 有多少标注员相互一致?
- 有多少标注员选择了最常见的答案?
用一个"每个标注员各选一个不同选项"的例子来演示:
- 标注员 1 选择 A
- 标注员 2 选择 B
- 标注员 3 选择 C
尽管没有任何两个标注员意见相同,一致性依然是1/3 = 33.33%:
- 有多少标注员相互一致?——3 名标注员中,每个选项都被 1/3 的人选择:
1/3 = 33.33% - 有多少标注员选择了最常见的答案?——A、B、C 各被选了一次,因此同样常见;3 名标注员中有 1 人选择了最常见答案:
1/3 = 33.33%
若切换到 Pairwise 方法论,同样的任务一致性将变为0%——因为 Pairwise 更关注标注员两两之间的一致程度。
Consensus 中的二值计分
Consensus 使用二值分数衡量一致性——每一对标注员要么匹配(1),要么不匹配(0)。
- 对Choices、Rating等分类标签,二值结果天然成立:两个标注员要么选了相同的值,要么没有;
- 对边界框、文本片段等非分类标签,原始比较产生连续分数(如 IoU 为
0.82),因此必须定义一个阈值来判断连续分数是否足够高、足以视为匹配,从而将连续分数转换为二值决策:- 达到或超过阈值记为匹配(
1),低于阈值记为不匹配(0)。
- 达到或超过阈值记为匹配(
一旦所有标注被约简为1或0,Consensus 即可计算整个群体整体收敛的程度。
5.2 Pairwise
正如名称所示,Pairwise 逐一考察每一对互不重复的标注员之间的一致性,然后对所有这些配对分数取平均。
沿用前面的例子(标注员 1/2/3 分别选择 A/B/C):Consensus 分数为33.33%,而 Pairwise 分数为0%:
- 标注员 1 vs 标注员 2(不匹配 =
0) - 标注员 1 vs 标注员 3(不匹配 =
0) - 标注员 2 vs 标注员 3(不匹配 =
0)
(0 + 0 + 0)/3 = 0
- 对分类标签,每一对产生二值结果:匹配记
1,不匹配记0,这些二值结果的平均值即为整体一致性; - 对边界框等非分类标签,每一对产生连续分数(如 IoU 为
0.82),这些原始分数直接取平均,无需任何阈值转换。
这意味着 Pairwise完整保留了非分类比较的粒度,对部分重叠给予奖励,而不是将其粗暴地化为"全有或全无"。
提示:对非分类标签使用 Consensus 方法论时,必须使用精确匹配或带阈值的连续指标;而 Pairwise 下,可以使用精确匹配、不带阈值的连续指标、或带阈值的连续指标三种方式。
5.3 Consensus vs Pairwise 一览
| 维度 | Pairwise | Consensus |
|---|---|---|
| 工作原理 | 逐一比较每对互不重复的标注员,对每对计分后取平均 | 用二值匹配/不匹配衡量整个群体向共同答案的收敛程度 |
| 所用分数类型 | 直接使用原始分数(分类为二值,非分类为连续) | 始终要求二值分数(匹配或不匹配) |
| 是否需要阈值 | 不需要——按原始分数直接计算 | 仅非分类标签需要;分类标签本身已是二值 |
| 部分得分 | 有——边界框重叠 0.6 即为平均值贡献 0.6 | 无——重叠要么高于阈值(匹配),要么低于阈值(不匹配) |
| 对离群值敏感度 | 高——一个持异见的标注员会形成多个低分配对,拉低平均值 | 低——单个持异见的标注员会被多数意见淹没 |
| 3 名标注员、2 人一致(分类) | 33%(3 对中仅 1 对匹配) | 66%(识别出多数一致) |
| 3 名标注员、全部一致 | 100% | 100% |
| 3 名标注员、全不一致 | 0% | 33%(3 人中 1 人选择了最常见答案) |
| 最适用场景 | 每个任务只有 2 名标注员,或需要细粒度连续分数 | 每个任务有 3 名及以上标注员,或多数一致最重要 |
5.4 何时选择 Pairwise vs Consensus
用最简单的话概括:
- Pairwise更适合你更关注标注员个体的场景;
- Consensus更适合你更关注多数标注员是否在某个答案上达成一致的场景。
Pairwise 适合的场景
Pairwise 回答的是"标注员彼此之间整体上有多一致":
- 当你关注评估标注员、想要发现标注池中的不一致/碎片化、找出任务与指令中的歧义时,Pairwise 是首选;
- 它对离群值更敏感(这有时正是你想要的——一个持异见的标注员会显著拉低分数);
- 对非分类控制标签(如
RectangleLabels、TextArea),Pairwise无需定义阈值,因此这类场景下配置更简单。
Consensus 适合的场景
Consensus 回答的是"任务在多大程度上收敛到了同一个答案":
- 更能反映多数一致,对大多数用户更直观;
- 对离群值更稳健(单个持异见的标注员影响较小);
- Consensus 度量是标签稳定性与任务收敛度的良好代理指标;
- 对非分类控制标签必须配置阈值——阈值正是你对"多接近才算一致"的定义。
5.5 计算示例
Categorical 示例
分类控制标签是拥有固定选项集合的控制标签,例如选项为 "Opossum"、"Cat"、"Hamster" 的控制标签。以下假设 3 名标注员在 "A"、"B"、"C" 三个选项间选择。
Pairwise 视角:
- 若三人各选不同选项,Pairwise 为
0:- 标注员 1 vs 标注员 2(不匹配 =
0) - 标注员 1 vs 标注员 3(不匹配 =
0) - 标注员 2 vs 标注员 3(不匹配 =
0) (0 + 0 + 0)/3 = 0
- 标注员 1 vs 标注员 2(不匹配 =
- 若标注员 2 改为与标注员 1 一致,一致性变为
33.33%:- 标注员 1 vs 2(匹配 =
1),1 vs 3(不匹配 =0),2 vs 3(不匹配 =0) (1 + 0 + 0)/3 = 0.33
- 标注员 1 vs 2(匹配 =
- 若标注员 3 也改为与标注员 1、2 一致,一致性变为
100%:(1 + 1 + 1)/3 = 1
正如所见,Pairwise 可能不如 Consensus 直观(例如标注员 3 改选后分数从 33.33% 跳到 100%),但它对离群值更敏感。
Consensus 视角:
- 三人各选不同选项时,Consensus 为
33.33%:A、B、C 各被选择一次、同样常见,3 人中 1 人选择了最常见答案(1/3 = 0.33)。这里不关心选项的具体值,只关心"有 3 个选项且标注员之间没有重叠选择"; - 标注员 2 改为与标注员 1 一致(A、A、C)后,一致性升至
66.67%:A 被选两次、C 被选一次,2/3 的人选择了最常见答案(2/3 = 0.66); - 标注员 3 也改为选 A(A、A、A)后,一致性达到
100%:3/3 的人选择了最常见答案(3/3 = 1.0)。
Non-categorical 示例
非分类控制标签产生不易量化为"匹配/不匹配"的连续值,典型如RectangleLabels、PolygonLabels、Labels。
边界框(Bounding boxes)
对图片进行边界框标注时,可使用Exact Match、Intersection over Union (IoU)或Intersection over Union (IoU) (Threshold)指标。下面重点看后两者。
IoU(交并比)用来衡量两个边界框的相似程度,核心思想是:
- Intersection(交集):两个框共同覆盖的区域
- Union(并集):两个框合计覆盖的总区域
IoU 的具体计算公式详见 Intersection over Union (IoU)。
Pairwise 视角:假设 3 名标注员使用RectangleLabels画框,采用Intersection over Union (IoU)指标:
- 若三个框画在图片中完全不同的区域、互不重叠,Pairwise 为
0%:(0 + 0 + 0)/3 = 0 - 若调整后出现部分重叠,一致性变为
40.67%:- 标注员 1 vs 2(IoU =
0.53) - 标注员 1 vs 3(IoU =
0.24) - 标注员 2 vs 3(IoU =
0.45) (0.53 + 0.24 + 0.45)/3 = 40.67%
- 标注员 1 vs 2(IoU =
Consensus 视角:Consensus 需要二值(0/1)分数,因此改用Intersection over Union (IoU) (Threshold)指标——它与上面 Pairwise 用到的 IoU 相同,但叠加了阈值:阈值决定什么算匹配(1)、什么不算匹配(0)。
假设阈值设为50%:任意一对 IoU ≥ 0.50 记为匹配(1),低于则不算(0)。
原始 IoU 分数为:标注员 1 vs 2 =0.53,1 vs 3 =0.24,2 vs 3 =0.45。
用阈值(50%)进行二值化:
- 标注员 1 vs 2:
0.53≥0.50→ 匹配 = 1 - 标注员 1 vs 3:
0.24≤0.50→ 不匹配 = 0 - 标注员 2 vs 3:
0.45≤0.50→ 不匹配 = 0
标注员 1 与标注员 2 一致,得到共识分数2/3 = 0.66。
更强的 IoU 一致性情形:现实中还存在"超过 2 人一致、但未到 3 人全部一致"的情况。例如:标注员 1 与 2 强重叠、标注员 2 与 3 强重叠、标注员 1 与 3 弱重叠。此时一致性会高于简单的 2/3 共识,以反映整体更强的吻合度(上例中一致性分数为80.47%)。
文本片段(Text spans)
对文本片段进行标注时,可使用Exact Match、Span Overlap或Span Overlap (Threshold)指标。Span Overlap 衡量标注员高亮区域的重合程度,具体算法见 Span Overlap。
Pairwise 视角:3 名标注员高亮文本片段并标注为 "Positive" 或 "Negative":
- 标注员 1 选 "Positive",高亮
Excellent tool= 字符 0–14 - 标注员 2 选 "Positive",高亮
tool= 字符 10–14 - 标注员 3 选 "Negative",高亮
tool= 字符 10–14
标注员 3 的重叠被否决,因为其对文本片段选择了不同标签:
- 标注员 1 vs 2:重叠为
4/14 = 0.29 - 标注员 1 vs 3:
0(标签不同) - 标注员 2 vs 3:
0(标签不同)
(0.29 + 0 + 0)/3 = 0.0966
Consensus 视角:同样的标注场景下,标注员 1 与 2 的重叠为 29%(4/14 = 0.29)。但 Consensus 需要二值分数判定匹配,因此必须为非分类标签选择阈值。假设阈值设得较低,为25%——标注员 1 与 2 提交的标注即被视为匹配。于是 3 名标注员中有 2 人一致,一致性分数为2/3 = 0.66。
更多计算示例可参考 built-in metrics reference。
六、其他一致性设置
选定方法论后,还可以在Settings > Quality > Agreement下配置其他一致性选项。
6.1 内置指标 vs 自定义指标
在Built-in Metrics vs Custom下,可以选择使用内置一致性指标,或编写代码自定义指标:
- 内置一致性指标(Built-In Agreement Metrics):选择后可使用 内置指标参考 中列出的全部指标;
- 自定义一致性指标(Custom Agreement Metrics):选择后可在文本框中编写代码创建自定义指标,详见 Add a custom agreement metric to Label Studio。
6.2 内置指标速查(按控制标签类型)
Label Studio 内置指标覆盖了从分类、数值到各类几何区域的全景需求,这里按标签类型给出速查表(详细计算方式见 agreement_metrics.md):
| 指标族 | 覆盖指标 | 适用标签 |
|---|---|---|
| 通用 | Exact Match(可带标签权重) | 所有标签 |
| Choices / Taxonomy | Common Labels Matches、(Threshold);Common Subtree Matches、(Threshold);Jaccard Similarity、(Threshold) | Taxonomy;Choices(多选) |
| 数值 | Numeric Difference、(Threshold) | Number、Rating |
| 矩形 | IoU、(Threshold);Bounding Box Labels/Text Similarity、(Threshold) | RectangleLabels、Rectangle 及嵌套标签 |
| 多边形 | IoU for Polygons、(Threshold);Polygon Labels/Text Similarity、(Threshold) | PolygonLabels、Polygon 及嵌套标签 |
| 刷子 | Brush IoU、(Threshold) | BrushLabels、Brush |
| 片段/分段 | Span Overlap、(Threshold);Span Labels/Text Similarity、(Threshold);TimelineLabels 无序朴素比较 | Labels、ParagraphLabels、TimeSeriesLabels、TimelineLabels 及嵌套标签 |
| HTML 片段 | Overlap over HTML Spans、(Threshold);HTML Span Labels/Text Similarity、(Threshold) | HyperTextLabels 及嵌套标签 |
| 文本 | Text Similarity(编辑距离)、(Threshold);Semantic Similarity(嵌入语义) | TextArea;用户自定义 |
| 视频 | Exact Frames Matching for Video、(Threshold);Video Tracking | VideoRectangle;用户自定义 |
| 关键点 | Keypoint Distance | KeypointLabels、Keypoint |
几个值得注意的内置指标要点:
- Exact Match是最简单也最严格的指标,无部分得分;对多选分类(如 3 项中匹配 2 项)若需要部分得分,应改用Jaccard Similarity(
|A∩B| / |A∪B|); - Span Overlap / IoU都采用"先校验标签是否一致(不一致直接记 0),再用贪心匹配(greedy matching)两两配对取最佳匹配并求平均"的流程;
- Text Similarity基于编辑距离(默认 Levenshtein),支持多种算法(Damerau-Levenshtein、Jaro-Winkler、Hamming、Ratcliff-Obershelp)与粒度(字符/二元组/三元组/词);
- Semantic Similarity通过嵌入向量的余弦相似度比较语义,默认阈值为
0.85; - Numeric Difference的公式为
score = 1 / (1 + difference),其阈值变体使用"最大差值"(默认1.0)作为容忍度,更贴合评分卡场景。
6.3 配置整体一致性权重(Configure weight for the overall agreement)
整体一致性是所有控制标签一致性分数的平均值,显示在 Data Manager 的主Agreement列中。
在Settings > Quality > Agreement > Overall Agreement下,可以通过为不同控制标签设置权重来定制整体一致性的计算方式,确保关键控制标签对整体分数有更大的影响力。
计算示例:某项目包含以下控制标签与权重:
- RectangleLabels:1.0
- Choices:0.3
- Rating:0.2
某个任务的逐控制标签一致性分数为:
- RectangleLabels:83%
- Choices:33%
- Rating:33%
则整体一致性计算为:
(1.0 * 83% + 0.3 * 33% + 0.2 * 33%) / (1.0 + 0.3 + 0.2) = 60.67%
即:加权求和后除以权重总和(加权平均),权重越大的控制标签对整体分数影响越大。
从源码看,项目级控制权重存储在Project模型的control_weightsJSON 字段中——迁移 0018_alter_project_control_weights.py 中清晰描述了其结构:每个控制标签以自身名称作为键,包含type(标签类型)、labels(各标签的权重字典)与overall(整体权重),例如:
{ "my_bbox": { "type": "RectangleLabels", "labels": {"Car": 1.0, "Airplaine": 0.5}, "overall": 0.33 } }这说明权重体系不仅支持控制标签级(overall),还深入到单个标签值级(labels),例如可以让 "Car" 标签在一致性计算中比 "Airplane" 重要一倍。
6.4 为每个控制标签配置一致性(Configure agreement for each control tag)
在Settings > Quality > Agreement > Agreement Columns下,可以定制每个控制标签的一致性计算方式。
可选指标取决于两件事:所选的一致性方法论与所配置的控制标签类型。各控制标签可用的指标清单见 内置指标参考。
七、源码层面的实现佐证
围绕"一致性"这一主题,当前仓库中还能找到以下实现证据,帮助理解其工程落地:
- 任务级一致性分数:
Task模型通过precomputed_agreement字段缓存任务预计算一致性,接口层在序列化时将其转换为 0–100 的百分比输出,见 tasks/api.py 与相关任务迁移 0058_task_precomputed_agreement.py; - 项目级配置模型:
Project模型携带agreement_threshold(最小一致性分数,用于决定任务是否可发送给 ML 后端)与control_weights等字段,相关的历史迁移(如 0001_squashed_0065)保留了这些字段的演进痕迹; - Data Manager 聚合:数据管理器的列定义与排序逻辑中内置了与一致性相关的字段识别(如
is_agreement_related_field),见 managers.py,并支持对参与一致性计算的标注员进行筛选(agreement_selected),前端默认选中"全部标注员、不含模型、不计 ground truth",见 agreementSelected.js; - 前端一致性看板工具:编辑器侧的 Agreement Dashboard 提供纯函数工具集,包括多数投票(Majority Vote)计算、一致性分数的三档配色(<0.33 红 / <0.66 黄 / ≥0.66 绿)以及完美一致(1.0)的浮点容差判断,见 agreement-utils.ts;
- 测试覆盖:
test_lazy_load_annotations.py中针对一致性接口编写了覆盖 Labels、Choices、Ratings、Taxonomy、多控制标签、取消标注排除等场景的用例,见 label_studio/tasks/tests/test_lazy_load_annotations.py。
八、配置建议与最佳实践
- 先明确评估目标,再选方法论:评估标注员个体表现、排查任务歧义时选Pairwise;评估任务收敛度、标签稳定性、或任务有 3 名以上标注员时选Consensus;
- 分类与非分类分开配置指标:分类标签默认 Exact Match,多选场景改用 Jaccard;非分类标签按数据类型选择 IoU 系列或 Span Overlap 系列,并为 Consensus 方法论设置合理的阈值;
- 善用权重突出关键维度:通过
Overall Agreement权重让关键控制标签主导整体分数,避免次要字段稀释核心质量信号; - 结合多维视图交叉验证:Data Manager 看任务级分数、数据质量看板看分布与混淆矩阵、成员看板看成员/模型一致性矩阵(注意其固定使用 Pairwise 口径);
- 把一致性分数接入质量闭环:利用
agreement_threshold等机制将低一致性任务标记出来,优先安排复审或重新标注,从而提升训练数据质量。
结语
任务一致性是 Label Studio 质量治理体系的核心度量之一。理解 Consensus 与 Pairwise 在数学语义、阈值需求与离群值敏感度上的差异,掌握分类/非分类控制标签的指标选择逻辑,并善用权重与逐标签配置,你就能把"标注员之间有多一致"从一句抽象的问题,转化为一套可配置、可量化、可复盘的质量管理流程,为模型训练与数据集评估提供坚实依据。
【免费下载链接】label-studioLabel Studio is a multi-type data labeling and annotation tool with standardized output format项目地址: https://gitcode.com/GitHub_Trending/la/label-studio
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考