机器学习(一):统计学习问题概述

程序员通勤双肩包,下单送全年 CSDN 会员 防泼水面料电脑包,保护笔记本电脑,背负轻便,下单再赠 Coding Plan,看技术干货、查文档、下载源码,站式搞定学习需求 阅读详情

学习:“如果一个系统能够通过执行某个过程改进它的性能,这就是学习。”按照这一观点,统计学习就是计算机系统通过运用数据及统计方法提供系统性能的机器学习。
机器学习的对象是数据,它从数据出发,提取数据特征,抽象出数据模型,发现数据中的知识,又回到对数据的分析和预测中去。[机器学习关于数据的基本假设是:同类数据具有一定的统计规律性。由于它们具有统计规律性,所以可以用概率统计方法来处理。]

1. 何时使用机器学习?

根据机器学习的性质,我们可以得出:
- 存在“underlying pattern”需要我们学习,因为机器学习依靠的就是从数据中抽象模型。
- 没有programmable(easy)definition。这可以类比于:编程方法是问题的精确解、规则化的解;而机器学习是概率统计上的解。那么,可以用编程方式解决的问题,传统编程方式自然是首选。
- 必须有data,因为机器学习的对象就是data。

2. 机器学习问题的形式化描述

2.1 机器学习形式化描述图

监督学习问题
几个术语:[输入输出变量用大写表示;输入输出变量所取的值用小写表示]
- 输入空间X:输入x的所有可能取值的集合;
- 输出空间Y:输出y的所有可能取值集合;
- 训练数据D;
- 未知的目标函数 f:X>Y (这也是机器学习想要求的理想解);
- 假设空间H:由输入空间到输出空间的映射的集合。H的确定意味着学习范围的确定

监督学习问题的文字描述:假设存在某目标函数 f:X>Y ,我们有从f按P(x)产生的N个数据,我们要使用这N个数据+学习算法A,来从假设空间中寻找一个函数g,使得: gf

2.2 机器学习方法的步骤

根据上面的描述,我们可以得到实现机器学习方法的步骤:
1. 得到一个有限的训练数据集合;
2. 确定包含所有可能的模型的假设空间,即学习模型的集合;
3. 确定模型选择的准则,即学习的策略;
4. 确定求解最优模型的算法,即学习的算法;
5. 通过学习方法选择最优模型;[3、4、5合起来就是学习算法A]
6. 利用学习的最优模型对新数据进行预测和分析。

上述的6个步骤都很重要,我们会逐个讲解,其中模型的假设空间、模型选择的准则和魔性学习的算法称为机器学习算法三要素,简称:模型(model)、策略(strategy)和算法(algorithm)。

2.3 进阶版机器学习形式化描述图

加噪声的监督学习
这与之间的图有两点不同;
1. 之前的training data D的来源是:(x,f(x))。其中x从服从某一概率分布P(x);现在我们假设D来源于(x,f(x)),其中x服从某一P(x),f(x)+Noise服从某一P(y);也即:X和Y服从某一联合概率分布P(x,y)。
2. 加入了error measure err和学习算法A中的 eˆrr 。[先忽视它们,后面会讲解]

根据上述的形式化描述,我们自然而然的产生如下问题:

3. Q1:学习策略是怎么的?

也即给定假设空间H,按照什么样的准则学习或选择出最优的模型g?
对于监督学习问题,假设从H中选择了一个决策函数f,那么f(X)与Y可能有差距,用一个损失函数(loss function)或代价函数(cost function)来度量预测错误的程度。
- 0-1损失函数
- 平方损失函数 L(Y,f(X))=(Yf(X))2
- 绝对损失函数 L(Y,f(X))=|Yf(X)|
- 对数损失函数 L(Y,P(Y|X))=logP(Y|X)

对于y={-1,1}的二分类问题有:
可视化损失函数

损失函数越小,模型就越好。损失函数的期望是:
Rexp(f)=Ep[L(Y,f(X))]=X×YL(y,f(x))P(x,y)dxdy
问题是 Rexp(f) 并不能直接计算,因为P未知。所以我们使用训练集的平均损失,称为经验风险或经验损失,来估计:
R

Machine Learning机器学习统计分析 机器学习种人工智能(AI)的分支领域,其目标是通过从数据中学习规律和模式,让计算机系统能够从经验中改善和自我完善。简单来说,机器学习种让计算机从数据中学习如何完成任务的方法,而无需明确地编程规则。通常情况下,机器学习算法会分析大量的数据,识别数据中的模式和趋势,并利用这些模式和趋势进行预测或决策。机器学习的关键在于自动化地从数据中发现规律和模式,并利用这些知识来解决新的问题或做出预测。监督学习(Supervised Learning) 阅读详情

相关推荐

机器学习中的统计学习理论

EM算法通过迭代更新隐变量的期望,最大化观测数据的似然函数,常用于处理含有隐变量的概率模型。

2302_81695297的博客 2162

机器学习】李航 统计学习方法 知识点总结

机器学习实战代码 阅读目录 知识点 感知机 k近邻法 朴素贝叶斯 决策树 logistic回归和最大熵模型 支持向量机 提升方法 EM算法 隐马尔可夫模型(HMM) 统计学习方法总结 神经网络 K-Means Bagging Apriori 降维方法 引用 因为要准备面试,本文以李航的《统计学习方法》为主,结合西瓜书等其他资料对机器学习知识做个整理. 知识点...

sowhat 1万+

机器学习笔记:关于机器学习

这本笔记的参考书目和课程为: 《机器学习基础教程》:机械工业出版社 模式识别与机器学习(PRML) 统计学习方法:清华大学出版社,李航 Deep Learning:Ian Goodfellow,Yoshua Bengio,Aaron Counrville 斯坦福《机器学习公开课》吴恩达 之后的内容都是来源于这几本书的学习和些反思,后面就不强调了。这里的机器学习默认是统计机器学习,后面

谢小小XH 4716

机器学习(深度学习)

Python语言机器学习工具Scikit-learn包括许多智能的机器学习算法的实现Scikit-learn文档完善,容易上手,丰富的API接口函数sklearnscikit-learn中文社区数据量小,数据在sklearn库的本地,只要安装了sklearn,不用上网就可以获取数据量大,数据只能通过网络获取。

2301_78581215的博客 3万+

机器学习数据预处理—统计分析方法

依据研究对象(样品或指标)的特征,对其进行分类的方法,减少研究对象的数目。各类事物缺乏可靠的历史资料,无法确定共有多少类别,目的是将性质相近事物归入类。各指标之间具有定的相关关系。变量类型:定类变量、定量(离散和连续)变量样本个体或指标变量按其具有的特性进行分类,寻找合理的度量事物相似性的统计量。

mnwl12_0的博客 3058

AI之路(二)——关于统计学习(statistical learning)Part 1 概论

从今日起,正式开启AI之路,在人工智能学习领域,无论机器学习还是深度学习,统计学习是入门的最好参考教材,是不可或缺的。因此,这漫漫求索之路,就从统计学习开始吧。 我所选择的是李航所著的统计学习(第二版),计划将我对本书的自学总结或心得,能及时地在此发布,希望能在业余时间里用年甚至更短的时间内完成此书的学习。 Now,Let’s GO! 统计学习的特点 统计学习(statistical learn...

达摩院院长的博客 1745

模式识别/机器学习百题(含大部分答案)

、概论1、简述模式的概念和它的直观特性,解释什么是模式识别,同时绘出模式识别系统的组成框图,并说明各部分的主要功能特性。对于存在于时间和空间中,可观察的物体,如果我们可以区分它们是否相同或相似,都可以称之为“模式”(或“模式类”)。模式所指的不是事物本身,而是从事物中获得的信息。因此,模式常常表现为具有时间和空间分布的信息。模式的直观特性包括:可观察性,可区分性,相似性。模式识别就是对模式的区分和

Chris's Notes 14万+

机器学习基本分类概述

机器学习基本分类

2301_81480617的博客 416

统计学习方法》第机器学习统计学习

机器学习统计学习 目录 机器学习统计学习 机器学习定义 二、机器学习和数据挖掘的关系 三、机器学习统计学习 四、统计学习 1、监督学习 2、无监督学习 3、强化学习 4、半监督学习 5、主动学习 五、统计学习方法 1、按算法分类 2、按技巧分类 3、统计学习三要素 4、模型评估与模型选择 5、正...

北冥有渔的博客 1479

统计学习方法——概述

统计学习方法李航第二版 第概述

ACG00的博客 4744

机器学习——统计学习方法概述

学习机器学习些入门概念,以下内容出自《统计学习方法》这本书第章的内容。 1 统计学习 统计学习(statistical learning)是关于计算机基于数据构建概率统计模型并运用模型对数据进行预测与分析的门学科。统计学习也称为统计机器学习(statistical machine learning)。 1.1统计学习的主要特点 (1)统计学习以计算机及网络为平台,是建立在计算机及网络之上的; (2)统计学习以数据为研究对象,是数据驱动的学科; (3)统计学习的目的是对数据进行预测与分析; (4)统计

C_teacher的博客 2664

机器学习概述

1.明确分析目标,2.数据收集,3.数据预处理,4.建模分析,5.结果评估,6.部署使用以及学习更新。1.明确分析目标:客观反映用户需求,通过对各类人群的深入分析,为相关部门制订资费、服务、市场 策略提供基础。2.数据收集:收集相关的数据,充足、全面的高质量数据是机器学习的基础。3.数据预处理:数据可能存在着噪声、不致、异常、个人隐私保护等各类 问题。为保证数据的质量,必要的数据治理是需要的。4.建模分析:此阶段是机器学习的核心部分,使用精巧复杂的分析方法从数据中提取知识。

2403_83637262的博客 2001

机器学习笔记概述

机器学习的公认定义[Mitchell, 1997]: A computer program is said to learn from experience E with respect to some class of tasks T and performance measure P if its performance at tasks in T, as measured by P,...

会说话的机器狗 505

大数据机器学习概述

2020.09.17 星期三课程笔记 1.学习资源 (1)在线课程 ①清华学堂在线-袁春老师的《大数据机器学习》 ②李宏毅的机器学习课程(中文) ③林轩田《机器学习基石上下》(中文) ④CV Stanford Li Feifei CS231N ⑤NLP Stanford CS224N ⑥Machine Learning: Andrew Ng 个人推荐这个可以看看 ⑦Neural Networks for Machine Learning: Geoffrey E. Hinton (2)参考书

baiweizeng的博客 2600

机器学习() 本文(3万字) | 机器学习概述 |

统计学习(statistical learning)是关于计算机基于数据构建概率统计模型并运用模型对数据进行预测与分析的门学科。统计学习也称为统计机器学习(statistical machine learning) 统计学习的主要特点是:(1)统计学习以计算机及网络为平台,是建立在计算机及网络上的:(2)统计学习以数据为研究对象,是数据驱动的学科:(3)统计学习的目的是对数据进行预测与分析:(4)统计学习以方法为中心,统计学习方法构建模型并应用模型进行预测与分析:(5)统计学习是概率论、统计学、信息论、

专注于人工智能学习,总结 1286

统计学习概述

系列文章目录 提示:这里可以添加系列文章的所有文章的目录,目录需要自己手动添加 例如:第章 Python 机器学习入门之pandas的使用 提示:写完文章后,目录可以自动生成,如何生成可参考右边的帮助文档 文章目录系列文章目录前言、pandas是什么?二、使用步骤1.引入库2.读入数据总结 前言 提示:这里可以添加本文要记录的大概内容: 例如:随着人工智能的不断发展,机器学习这门技术也越来越重要,很多人都开启了学习机器学习,本文就介绍了机器学习的基础内容。 提示:以下是本篇文章正文内容,下面案例

qq_42571025的博客 315

统计学习方法概述

统计学习方法概论学习统计学习统计学习的特点统计学习的目的统计学习的方法监督学习基本概念输入空间、特征空间与输出空间联合概率分布假设空间统计学习三要素模型策略损失函数和风险函数损失函数风险函数经验风险最小化和结构风险最小化算法过拟合与模型选择正则化交叉验证简单交叉验证K折交叉验证留交叉验证泛化能力泛化误差上界生成方法和判别方法生成方法判别方法分类问题功能快捷键合理的创建标题,有助于目录的生成如何改变文本的样式插入链接与图片如何插入段漂亮的代码片生成个适合你的列表创建个表格设定内容居中、居左、居右Sma

Just_do_myself的博客 3844

札记_ML——《统计学习方法》.概述

统计学习方法》 预备知识与概述 向量与矩阵 梯度 逻辑回归 模型、策略、算法 评价指标

Fuguir™的博客 1313
上一篇: Qt学习笔记外观篇(八):QComboBox
下一篇: 机器学习(二):如何使用机器学习来解决一个问题?
wangyanphp
博客等级 码龄14年 90粉丝 51原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值