我们的论文《Corruptions of Supervised Learning Problems: Typology and Mitigations》已发表于Journal of Machine Learning Research(JMLR),这是机器学习领域筛选最严格的期刊之一。这项研究由Sentinel Assurance联合创始人Nan Lu,与图宾根大学的Laura Iacovissi、Robert C. Williamson共同完成。
这篇论文做了什么
几乎所有监督学习理论都假设训练数据是干净的。但现实中很少如此:标签会被错误标注,特征会被污染或缺失,二者还可能以相互依赖的方式同时被污染。此前的研究只覆盖了这幅图景的一部分,尚不存在对"污染"本身的统一定义。
- 提出了一套单一的、通用的污染理论,将污染建模为作用于数据分布的马尔可夫核,涵盖标签污染、特征污染,以及二者相互依赖的组合污染。
- 给出了一套可证明穷尽的污染类型分类体系,统一了此前被分别研究的多种模型。
- 系统分析了每种污染类型如何扭曲学习问题的贝叶斯风险,也就是任何模型表现的理论下限。
- 提出的应对方法,将原本只针对简单标签噪声设计的经典损失校正技术,扩展到了更困难的依赖型与联合型污染场景。
"仅限标签"这一假设最值得关注。现有文献中的大多数校正方法只修正损失函数,这在污染只发生在标签上时是有效的。但一旦污染同时触及输入特征,修正就必须深入到假设类本身,而不能只停留在损失函数层面。
我们的看法
一个机器学习系统所给出的每一项保证,都建立在关于其训练数据的某种假设之上。这个假设被打破的频率,远比大多数团队所核查的更高,而且它被打破的方式,往往不会在一个干净的验证集上显现出来。这正是我们认为,在决定该给予一个模型多少信任时值得关注的那类缺口,也是我们希望在建立于这些机器学习系统之上的Agent获得更多自主权之前,率先严谨回答的一类基础问题。