跳至主要内容
返回文章列表
约 1 分钟阅读

不要只看平均分:模型评估中的分组与分布

为什么整体均值会掩盖重要差异,以及如何用分组报告补充模型评估。

平均准确率适合快速比较,却可能掩盖类别、样本来源和时间上的系统差异。一个总体更高的模型,也可能在关键子群上明显退步。

先定义有意义的分组

分组不应只为了“多画几张图”。它应来自研究问题、数据生成过程或实际使用条件。例如在时间跨度较长的数据中,按采集阶段报告结果可能比随机切分更能揭示分布变化。

同时报告样本量

小样本组的指标波动更大。只给百分比而隐藏分母,会让读者误判差异的稳定性。我的默认表格现在同时包含样本量、点估计和置信区间。

把最差表现作为诊断入口

最差分组指标不一定适合直接优化,但很适合定位错误模式。先阅读样本、检查标注和输入分布,再决定问题来自模型、数据还是分组方式本身。