Welcome

欢迎来到 Julio 个人blog,主要记录数理统计、机器学习、程序设计以及各种技术和日常思考。更多文章索引请浏览 归档分类标签

MCMC与Gibbs采样

随机模拟

  随机模拟(或者统计模拟)方法有一个很酷的别名是蒙特卡罗方法(Monte Carlo Simulation)。这个方法的发展始于20世纪40年代,和原子弹制造的曼哈顿计划密切相关,当时的几个大牛,包括乌拉姆、冯.诺依曼、费米、费曼、Nicholas Metropolis, 在美国洛斯阿拉莫斯国家实验室研究裂变物质的中子连锁反应的时候,开始使用统计模拟的方法,并在最早的计算机上进行编程实现。

指数分布族

指数分布族是指可以表示为指数分布的概率分布。指数分布形式如下:$$P(y;\eta)=b(y)exp(\eta^{T}T(y)-\alpha(\eta))$$其中,$\eta$成为分布的自然参数;$T(y)$是充分统计量,通常$T(y)=y$。当$a、b、T$参数都固定的时候,就定义了一个以 $\eta$ 为参数的指数函数族。

矩阵分解相关知识回顾

特征值与特征向量

设A是数域F上的n阶矩阵,如果存在数域F中的一个数$\lambda$与数域上F的非零向量$\overrightarrow{\alpha}$,使得:$A\overrightarrow{\alpha}=\lambda \overrightarrow{\alpha}$则称$\lambda$为A的一个特征值(根)(eigenvalue),称$\overrightarrow{\alpha}$为A的属于特征值$\lambda$的特征向量(eigenvector)。

数理统计学:世纪末的回顾与展望

作者:陈希孺

一、20世纪数理统计学发展概述

20世纪,特别是其上半叶,是数理统计学发展史上一个辉煌的时代。从现代数理统计学框架的建立到发展为一个成熟的学科,是在这个时期完成的。20世纪初,数理统计学面临一个转折点,意思是它必须有新的突破才能获得进一步发展的契机。20世纪早期一批以费歇尔(R.A.Fisher)为首的统计学大师成功地应对了这个局面,创造了非凡的业绩。按照国际上一些知名统计学家的看法,20世纪末数理统计学发展的态势,与世纪初颇有相似的地方。人们在呼唤“21世纪的费歇尔(Fisher)”。当然,广义地说,这也是每一位数理统计工作者所肩负的任务。中国作为一个世界大国,年轻一代的数理统计学者应该也有条件在这方面作出自己的贡献。为了更清楚阐述上文的意思,需要对数理统计学的历史作一个简短的回顾。按目前数理统计学界公认的看法,数理统计学是“收集和分析带随机性的数据的科学和艺术”。以笔者的看法,这个内涵规定了它是一个中立性的工具。“中立”的意思是指这门学科不带任何社会的、政治的或意识形态上的倾向性,因而也不存在它自成学派或从属于何学派的问题。有一种看法认为社会经济统计学与数理统计学是“大统计学”中的两个对立的学派。笔者认为这种看法值得商榷。的确,在社会经济统计学中该不该使用数理统计方法,在哪些问题上或者在何种程度上应否使用数理统计方法,是可能存在不同意见的。如果说由于对这些问题的看法不同而有学派存在,那还算言之成理。但这些问题与数理统计学无关:数理统计学只是一种工具,谁如觉得这个工具对他有用,就可以使用它——当然在使用中必须遵守这门学科的规范,否则就可能产生误导公众及提供错误的决策依据的后果。历史上(部分地直到如今)数理统计方法曾遭到一些批评和怀疑,一定程度上与上述情况有关。数理统计学起源于何时?这是一个无法也不必做出定论的问题。有的学者把英国学者格朗特(John Graunt)的著作《关于死亡公报的自然和政治观察》发表的年份1662年定为这门学科的诞生之日,恐怕也只能算是一家之见。实际情况是,可以说直到20世纪初,并不存在一门统一的数理统计学科,而中是在各实用领域中的学者因工作上的需要而分头发展了一些分析数据的方法,即统计方法。

优化算法篇之梯度法

我们在接触到具体的机器学习算法前,其实很有必要对优化问题进行一些了解。随着学习的深入,越来越发现最优化方法的重要性,学习和工作中遇到的大多问题都可以建模成一种最优化模型进行求解,比如我们现在学习的机器学习算法,大部分的机器学习算法的本质都是建立优化模型,通过最优化方法对目标函数(或损失函数)进行优化,从而训练出最好的模型。