荐号 | 如何优雅地读懂支持向量机SVM算法 - 专知

会员服务 ·

0

荐号 | 如何优雅地读懂支持向量机SVM算法

2018 年 1 月 9 日 机器之心 超级数学建模

本文转自公众号“超级数学建模”（微信ID：supermodeling），以最好玩的方式科普数学知识，最强数学干货分享，被称为“3~99岁都可以关注的数学科普公众号”，由多名企业与高校KDD专家维护。

简介

支持向量机基本上是最好的有监督学习算法了。最开始接触SVM是去年暑假的时候，老师要求交《统计学习理论》的报告，那时去网上下了一份入门教程，里面讲的很通俗，当时只是大致了解了一些相关概念。

这次斯坦福提供的学习材料，让我重新学习了一些SVM知识。我看很多正统的讲法都是从VC 维理论和结构风险最小原理出发，然后引出SVM什么的，还有些资料上来就讲分类超平面什么的。

这份材料从前几节讲的logistic回归出发，引出了SVM，既揭示了模型间的联系，也让人觉得过渡更自然。

重新审视logistic回归

Logistic回归目的是从特征学习出一个0/1分类模型，而这个模型是将特性的线性组合作为自变量，由于自变量的取值范围是负无穷到正无穷。

因此，使用logistic函数（或称作sigmoid函数）将自变量映射到(0,1)上，映射后的值被认为是属于y=1的概率。

形式化表示就是

假设函数

clip_image001

其中x是n维特征向量，函数g就是logistic函数。

的图像是

clip_image003

可以看到，将无穷映射到了(0,1)。

而假设函数就是特征属于y=1的概率。

clip_image004

当我们要判别一个新来的特征属于哪个类时，只需求，若大于0.5就是y=1的类，反之属于y=0类。

再审视一下，发现只和有关，>0，那么，g(z)只不过是用来映射，真实的类别决定权还在。还有当时，=1，反之=0。

如果我们只从出发，希望模型达到的目标无非就是让训练数据中y=1的特征，而是y=0的特征。

Logistic回归就是要学习得到，使得正例的特征远大于0，负例的特征远小于0，强调在全部训练实例上达到这个目标。

图形化表示如下：

clip_image017

中间那条线是，logistic回顾强调所有点尽可能地远离中间那条线。学习出的结果也就中间那条线。

考虑上面3个点A、B和C。从图中我们可以确定A是×类别的，然而C我们是不太确定的，B还算能够确定。这样我们可以得出结论，我们更应该关心靠近中间分割线的点，让他们尽可能地远离中间线，而不是在所有点上达到最优。

因为那样的话，要使得一部分点靠近中间线来换取另外一部分点更加远离中间线。我想这就是支持向量机的思路和logistic回归的不同点，一个考虑局部（不关心已经确定远离的点），一个考虑全局（已经远离的点可能通过调整中间线使其能够更加远离）。这是我的个人直观理解。

形式化表示

我们这次使用的结果标签是y=-1,y=1，替换在logistic回归中使用的y=0和y=1。同时将替换成w和b。

以前的，其中认为。现在我们替换为b，后面替换为（即）。这样，我们让，进一步。

也就是说除了y由y=0变为y=-1，只是标记不同外，与logistic回归的形式化表示没区别。再明确下假设函数

上一节提到过我们只需考虑的正负问题，而不用关心g(z)，因此我们这里将g(z)做一个简化，将其简单映射到y=-1和y=1上。映射关系如下：

函数间隔（functional margin）和几何间隔（geometric margin）

给定一个训练样本，x是特征，y是结果标签。i表示第i个样本。我们定义函数间隔如下：

可想而知，当时，在我们的g(z)定义中，，的值实际上就是。反之亦然。

为了使函数间隔最大（更大的信心确定该例是正例还是反例），当时，应该是个大正数，反之是个大负数。因此函数间隔代表了我们认为特征是正例还是反例的确信度。

继续考虑w和b，如果同时加大w和b，比如在前面乘个系数比如2，那么所有点的函数间隔都会增大二倍，这个对求解问题来说不应该有影响，因为我们要求解的是，同时扩大w和b对结果是无影响的。

这样，我们为了限制w和b，可能需要加入归一化条件，毕竟求解的目标是确定唯一一个w和b，而不是多组线性相关的向量。这个归一化一会再考虑。

刚刚我们定义的函数间隔是针对某一个样本的，现在我们定义全局样本上的函数间隔

说白了就是在训练样本上分类正例和负例确信度最小那个函数间隔。

接下来定义几何间隔，先看图

clip_image059

假设我们有了B点所在的分割面。任何其他一点，比如A到该面的距离以表示，假设B就是A在分割面上的投影。

我们知道向量BA的方向是（分割面的梯度），单位向量是。A点是，所以B点是x=（利用初中的几何知识），带入得，

进一步得到

clip_image070

实际上就是点到平面距离。

再换种更加优雅的写法：

clip_image071

当时，不就是函数间隔吗？是的，前面提到的函数间隔归一化结果就是几何间隔。

他们为什么会一样呢？因为函数间隔是我们定义的，在定义的时候就有几何间隔的色彩。同样，同时扩大w和b，w扩大几倍，就扩大几倍，结果无影响。同样定义全局的几何间隔

最优间隔分类器（optimal margin classifier）

回想前面我们提到我们的目标是寻找一个超平面，使得离超平面比较近的点能有更大的间距。也就是我们不考虑所有的点都必须远离超平面，我们关心求得的超平面能够让所有点中离它最近的点具有最大间距。

形象的说，我们将上面的图看作是一张纸，我们要找一条折线，按照这条折线折叠后，离折线最近的点的间距比其他折线都要大。形式化表示为：

clip_image077

这里用=1规约w，使得是几何间隔。

到此，我们已经将模型定义出来了。如果求得了w和b，那么来一个特征x，我们就能够分类了，称为最优间隔分类器。接下的问题就是如何求解w和b的问题了。

由于不是凸函数，我们想先处理转化一下，考虑几何间隔和函数间隔的关系，，我们改写一下上面的式子：

clip_image084

这时候其实我们求的最大值仍然是几何间隔，只不过此时的w不受的约束了。然而这个时候目标函数仍然不是凸函数，没法直接代入优化软件里计算。我们还要改写。

前面说到同时扩大w和b对结果没有影响，但我们最后要求的仍然是w和b的确定值，不是他们的一组倍数值，因此，我们需要对做一些限制，以保证我们解是唯一的。

这里为了简便我们取。这样的意义是将全局的函数间隔定义为1，也即是将离超平面最近的点的距离定义为。由于求的最大值相当于求的最小值，因此改写后结果为：

clip_image093

这下好了，只有线性约束了，而且是个典型的二次规划问题（目标函数是自变量的二次函数）。代入优化软件可解。

到这里发现，这个讲义虽然没有像其他讲义一样先画好图，画好分类超平面，在图上标示出间隔那么直观，但每一步推导有理有据，依靠思路的流畅性来推导出目标函数和约束。

来源：JerryLead

http://www.cnblogs.com/jerrylead/archive/2011/03/13/1982639.html

本文节选自“超级数学建模”公众号

-----这里是数学思维的聚集地------

如果你是科学爱好者，在这里，你会遇到很多数学大神，可以和他们一起探讨问题；如果你是科技小白，在这里，你会学到很多有趣的数学知识，感叹数学竟然是如此的简单有趣。

50万数学精英都在关注！来来来，就差你啦！

登录查看更多

0

相关内容

函数间隔

【经典书】算法基础：打开算法之门，Algorithm unlocked，237页pdf

【经典书】算法基础：打开算法之门，Algorithm unlocked，237页pdf

专知会员服务

146+阅读 · 2020年7月3日

【实用书】学习用Python编写代码进行数据分析，103页pdf

【实用书】学习用Python编写代码进行数据分析，103页pdf

专知会员服务

198+阅读 · 2020年6月29日

【2020新书】监督机器学习，156页pdf，剑桥大学出版社

【2020新书】监督机器学习，156页pdf，剑桥大学出版社

专知会员服务

153+阅读 · 2020年6月27日

最新《自动微分手册》77页pdf

最新《自动微分手册》77页pdf

专知会员服务

103+阅读 · 2020年6月6日

【干货书】Python概率图模型实现，284页pdf带你实战学习概率图模型

【干货书】Python概率图模型实现，284页pdf带你实战学习概率图模型

专知会员服务

236+阅读 · 2020年4月8日

机器学习速查手册，135页pdf

机器学习速查手册，135页pdf

专知会员服务

342+阅读 · 2020年3月15日

国科大UCAS胡包钢教授《信息论与机器学习》课程第三讲：信息论基础二

国科大UCAS胡包钢教授《信息论与机器学习》课程第三讲：信息论基础二

专知会员服务

70+阅读 · 2020年3月2日

【经典书】精通机器学习特征工程，中文版，178页pdf

【经典书】精通机器学习特征工程，中文版，178页pdf

专知会员服务

360+阅读 · 2020年2月15日

人工智能算法工程师手册-程序员写的AI书《深度学习，统计学习，数学基础》，50章一书打尽

人工智能算法工程师手册-程序员写的AI书《深度学习，统计学习，数学基础》，50章一书打尽

专知会员服务

211+阅读 · 2019年11月29日

【机器学习】一文读懂线性回归、岭回归和Lasso回归

【机器学习】一文读懂线性回归、岭回归和Lasso回归

AINLP

20+阅读 · 2019年10月12日

从零推导支持向量机 (SVM)

从零推导支持向量机 (SVM)

AI科技评论

10+阅读 · 2019年2月7日

SVM大解密（附代码和公式）

SVM大解密（附代码和公式）

机器学习算法与Python学习

6+阅读 · 2018年5月22日

从示例中理解SVM算法（附代码）

从示例中理解SVM算法（附代码）

论智

9+阅读 · 2018年5月10日

动手写机器学习算法：SVM支持向量机（附代码）

动手写机器学习算法：SVM支持向量机（附代码）

七月在线实验室

12+阅读 · 2017年12月5日

支持向量机分类实战

支持向量机分类实战

全球人工智能

4+阅读 · 2017年10月18日

机器学习(18)之支持向量机原理(三)线性不可分支持向量机与核函数

机器学习(18)之支持向量机原理(三)线性不可分支持向量机与核函数

机器学习算法与Python学习

3+阅读 · 2017年9月23日

机器学习（13）之最大熵模型详解

机器学习（13）之最大熵模型详解

机器学习算法与Python学习

7+阅读 · 2017年8月24日

机器学习(7)之感知机python实现

机器学习(7)之感知机python实现

机器学习算法与Python学习

4+阅读 · 2017年7月23日

从逻辑回归到最大熵模型

从逻辑回归到最大熵模型

夕小瑶的卖萌屋

4+阅读 · 2017年7月11日

Hyper-Parameter Optimization: A Review of Algorithms and Applications

Hyper-Parameter Optimization: A Review of Algorithms and Applications

Arxiv

16+阅读 · 2020年3月12日

A Review on Generative Adversarial Networks: Algorithms, Theory, and Applications

A Review on Generative Adversarial Networks: Algorithms, Theory, and Applications

Arxiv

59+阅读 · 2020年1月20日

A Modern Introduction to Online Learning

A Modern Introduction to Online Learning

Arxiv

21+阅读 · 2019年12月31日

vGraph: A Generative Model for Joint Community Detection and Node Representation Learning

vGraph: A Generative Model for Joint Community Detection and Node Representation Learning

Arxiv

14+阅读 · 2019年9月17日

Generalized Intersection over Union: A Metric and A Loss for Bounding Box Regression

Arxiv

6+阅读 · 2019年2月25日

Optimization Models for Machine Learning: A Survey

Arxiv

18+阅读 · 2019年1月16日

Deep Learning on Graphs: A Survey

Arxiv

53+阅读 · 2018年12月11日

A Survey of Learning Causality with Data: Problems and Methods

A Survey of Learning Causality with Data: Problems and Methods

Arxiv

19+阅读 · 2018年9月25日

A Survey on Dialogue Systems: Recent Advances and New Frontiers

Arxiv

11+阅读 · 2018年1月11日

SSD: Single Shot MultiBox Detector

Arxiv

5+阅读 · 2016年12月29日

VIP会员

相关主题

支持向量机

对数几率回归（LR）

相关VIP内容

【经典书】算法基础：打开算法之门，Algorithm unlocked，237页pdf

【经典书】算法基础：打开算法之门，Algorithm unlocked，237页pdf

专知会员服务

146+阅读 · 2020年7月3日

【实用书】学习用Python编写代码进行数据分析，103页pdf

【实用书】学习用Python编写代码进行数据分析，103页pdf

专知会员服务

198+阅读 · 2020年6月29日

【2020新书】监督机器学习，156页pdf，剑桥大学出版社

【2020新书】监督机器学习，156页pdf，剑桥大学出版社

专知会员服务

153+阅读 · 2020年6月27日

最新《自动微分手册》77页pdf

最新《自动微分手册》77页pdf

专知会员服务

103+阅读 · 2020年6月6日

【干货书】Python概率图模型实现，284页pdf带你实战学习概率图模型

【干货书】Python概率图模型实现，284页pdf带你实战学习概率图模型

专知会员服务

236+阅读 · 2020年4月8日

机器学习速查手册，135页pdf

机器学习速查手册，135页pdf

专知会员服务

342+阅读 · 2020年3月15日

国科大UCAS胡包钢教授《信息论与机器学习》课程第三讲：信息论基础二

国科大UCAS胡包钢教授《信息论与机器学习》课程第三讲：信息论基础二

专知会员服务

70+阅读 · 2020年3月2日

【经典书】精通机器学习特征工程，中文版，178页pdf

【经典书】精通机器学习特征工程，中文版，178页pdf

专知会员服务

360+阅读 · 2020年2月15日

人工智能算法工程师手册-程序员写的AI书《深度学习，统计学习，数学基础》，50章一书打尽

人工智能算法工程师手册-程序员写的AI书《深度学习，统计学习，数学基础》，50章一书打尽

专知会员服务

211+阅读 · 2019年11月29日

热门VIP内容

开通专知VIP会员享更多权益服务

《在GNSS信号降级环境中利用共识实现无人机集群稳健协调》

操作系统智能体：基于多模态大模型（MLLM）的通用计算设备智能体综述

《面向无人机集群的避障动态传感器覆盖算法》最新38页

【博士论文】推进数据高效的深度学习：非参数 Transformer、主动测试与上下文学习

相关资讯

【机器学习】一文读懂线性回归、岭回归和Lasso回归

【机器学习】一文读懂线性回归、岭回归和Lasso回归

AINLP

20+阅读 · 2019年10月12日

从零推导支持向量机 (SVM)

从零推导支持向量机 (SVM)

AI科技评论

10+阅读 · 2019年2月7日

SVM大解密（附代码和公式）

SVM大解密（附代码和公式）

机器学习算法与Python学习

6+阅读 · 2018年5月22日

从示例中理解SVM算法（附代码）

从示例中理解SVM算法（附代码）

论智

9+阅读 · 2018年5月10日

动手写机器学习算法：SVM支持向量机（附代码）

动手写机器学习算法：SVM支持向量机（附代码）

七月在线实验室

12+阅读 · 2017年12月5日

支持向量机分类实战

支持向量机分类实战

全球人工智能

4+阅读 · 2017年10月18日

机器学习(18)之支持向量机原理(三)线性不可分支持向量机与核函数

机器学习(18)之支持向量机原理(三)线性不可分支持向量机与核函数

机器学习算法与Python学习

3+阅读 · 2017年9月23日

机器学习（13）之最大熵模型详解

机器学习（13）之最大熵模型详解

机器学习算法与Python学习

7+阅读 · 2017年8月24日

机器学习(7)之感知机python实现

机器学习(7)之感知机python实现

机器学习算法与Python学习

4+阅读 · 2017年7月23日

从逻辑回归到最大熵模型

从逻辑回归到最大熵模型

夕小瑶的卖萌屋

4+阅读 · 2017年7月11日

相关论文

Hyper-Parameter Optimization: A Review of Algorithms and Applications

Hyper-Parameter Optimization: A Review of Algorithms and Applications

Arxiv

16+阅读 · 2020年3月12日

A Review on Generative Adversarial Networks: Algorithms, Theory, and Applications

A Review on Generative Adversarial Networks: Algorithms, Theory, and Applications

Arxiv

59+阅读 · 2020年1月20日

A Modern Introduction to Online Learning

A Modern Introduction to Online Learning

Arxiv

21+阅读 · 2019年12月31日

vGraph: A Generative Model for Joint Community Detection and Node Representation Learning

vGraph: A Generative Model for Joint Community Detection and Node Representation Learning

Arxiv

14+阅读 · 2019年9月17日

Generalized Intersection over Union: A Metric and A Loss for Bounding Box Regression

Arxiv

6+阅读 · 2019年2月25日

Optimization Models for Machine Learning: A Survey

Arxiv

18+阅读 · 2019年1月16日

Deep Learning on Graphs: A Survey

Arxiv

53+阅读 · 2018年12月11日

A Survey of Learning Causality with Data: Problems and Methods

A Survey of Learning Causality with Data: Problems and Methods

Arxiv

19+阅读 · 2018年9月25日

A Survey on Dialogue Systems: Recent Advances and New Frontiers

Arxiv

11+阅读 · 2018年1月11日

SSD: Single Shot MultiBox Detector

Arxiv

5+阅读 · 2016年12月29日

大家都在搜

久别重逢话双塔

大型语言模型

国防科技创新

软件无线电

无人机测控通信自组网技术综述

微信扫码咨询专知VIP会员