研究

我们关于弱监督学习的著作,由MIT Press出版

大多数机器学习理论都假设数据拥有完整且正确的标签。这本书是为更常见的情况准备的经验风险最小化指南:你并没有这样的标签。

← 返回研究

我们的著作《Machine Learning from Weak Supervision: An Empirical Risk Minimization Approach》由MIT Press出版,收录于Adaptive Computation and Machine Learning系列。本书由Sentinel Assurance联合创始人Nan Lu,与Masashi Sugiyama、Han Bao、Takashi Ishida、Tomoya Sakai、Gang Niu共同完成。

这本书讲了什么

  • 提出了一套统一的经验风险最小化框架,用于弱监督学习,涵盖正例-无标签(PU)分类、正例-负例-无标签(PNU)分类等场景。
  • 为标签缺失或不完整(而不仅仅是带噪声)情况下的学习提供了理论基础。
  • 在理论之外提供了配套的实用算法,既面向应用这些方法的从业者,也面向在此基础上继续研究的学者。

贯穿全书的主线是:"没有足够干净的标签"并不是一个可以靠启发式方法绕过的边缘情况。它足够常见,也足够有结构,值得获得与完全监督学习同等的严谨对待。

我们的看法

我们所关心的许多有趣的失效模式,其根源都在模型的上游:它究竟是在什么数据上训练的,又被要求优化什么目标。一套关于弱监督学习的严谨理论,正是这样一类基础性工作,它让我们能够精确推理一个模型究竟能被期待知道什么、不能知道什么,而这件事值得在下游有任何环节依赖它之前先弄清楚。

想和研究团队聊聊?

我们很乐意分享Sentinel背后的研究工作,或探讨它如何应用于你的AI Agent。