平均准确率适合快速比较,却可能掩盖类别、样本来源和时间上的系统差异。一个总体更高的模型,也可能在关键子群上明显退步。
先定义有意义的分组
分组不应只为了“多画几张图”。它应来自研究问题、数据生成过程或实际使用条件。例如在时间跨度较长的数据中,按采集阶段报告结果可能比随机切分更能揭示分布变化。
同时报告样本量
小样本组的指标波动更大。只给百分比而隐藏分母,会让读者误判差异的稳定性。我的默认表格现在同时包含样本量、点估计和置信区间。
把最差表现作为诊断入口
最差分组指标不一定适合直接优化,但很适合定位错误模式。先阅读样本、检查标注和输入分布,再决定问题来自模型、数据还是分组方式本身。