Welcome

欢迎来到 Julio 个人blog,主要记录数理统计、机器学习、程序设计以及各种技术和日常思考。更多文章索引请浏览 归档、分类 和 标签。

VC维理论-统计学习理论基础

目录:

  • 说说历史
  • Hoeffding不等式
  • Connection to Learning
  • 学习可行的两个核心条件
  • Effective Number of Hypotheses
  • Growth Function
  • Break Point与Shatter
  • VC Bound
  • VC dimension
  • 深度学习与VC维
  • 小结
  • 参考文献

VC维在机器学习领域是一个很基础的概念,它给诸多机器学习方法的可学习性提供了坚实的理论基础,但有时候,对我们而言,SVM,LR,深度学习等可能都已经用到线上了,但却不理解VC维。

Lasso回归算法

关于P值滥用的简要介绍

计量模型中关于变量选择,很多同学可能第一个想到的是:前进法,后退法,向前向后逐步回归。但是,这些方法存在一些固有的缺陷,它们会导致某些可能为最优的变量组合无法共同进入模型。

我们抛开传统的统计学教材,把眼光瞄向统计学习理论,就会发现,其实有大量的模型可供我们选择。今天,先介绍最基础的方法:Lasso。

因果推断:工具变量(Instrumental Variable)

一、线性回归和最小二乘法

线性模型和最小二乘的理论起源于高斯的天文学研究,“回归”(regression)这个名字则是 Francis Galton 在研究优生学的时候提出来的。为了描述的方便,我们假定回归的自变量只有一维,比如个体$i$是否接受某种处理(吸烟与否;参加某个工作;等等),记为$D_i$。 回归的因变量也是一维,表示我们关心的结果(是否有肺癌;是否找到工作培训与否;等等),记为$Y_i$。假定我们的研究中有 $n$ 个个体,下面的线性模型用于描述$D$和$Y$之间的“关系”:

JUMP少年周刊-最全漫画排行榜

其中,一些台词我们仍记忆犹新诸如

龟–派–汽–功 $\quad \Rightarrow $ 七龙珠
你已经死了 $\quad \Rightarrow $北斗神拳
教练我想打篮球! $\quad \Rightarrow $灌篮高手
燃烧吧,小宇宙 $\quad \Rightarrow $圣斗士星矢
我可是要当海贼王的男人 $\quad \Rightarrow $One Peice

JUMP的连载原则:把在十话内没有得到读者青睐的漫画统统砍掉,并要求高人气作品不准完结,要不顾剧情发展的连载下去。虽然,这样的的条款压抑了创作者空间,但是作为一个企业来说,JUMP以这样的原则给我们呈现了数不清的优秀作品,也获得了巨大的商业成功,稳居日本漫画龙头地位。

广义矩估计(GMM)方法

首先广义矩估计($GMM$)很容易使我们联想到统计学中参数估计方法之一的矩估计。

矩估计

矩估计是什么呢?简单的说,就是用样本矩代替总体矩进行统计推断的方法。

一个最基础的例子是正态总体的参数估计问题。如果$x_i \sim N(\mu,{\sigma}^2)$,如何估计$\mu$和$\sigma$呢?本科的统计学一般会介绍两种方法:极大似然估计和矩估计。其中矩估计是我们今天的主角。观察到: