ML系列笔记一:基本概念

限时加码!20+主流AI编程工具免费用 购周边加赠Coding Plan Lite,Claude Code、Cursor等即刻畅享,学习进阶更高效! 阅读详情

这是学习周志华老师《机器学习》的一些重要概念的简要笔记 ,仅防个人忘记

机器学习所研究的主要内容是“学习算法”,即关于在计算机上从数据中产生“模型”的算法

基本术语

  1. 属性空间(attribute space) / 样本空间(sample space) / 输入空间:由属性张成的空间。位于该空间的一个实例称为“特征向量(feature vector)”
  2. 通过学习算法从数据中学得模型的过程称为“学习”(learning)或者“训练”(training)。学得的模型对应了关于数据的某种潜在的规律,因此称为“假设(hypothesis)”;该潜在规律的自身,则称为“真相”或“真实”(ground-truth),学习过程即为了找出或逼近真相。所学得的“模型”,亦可称为“学习器”(learner),可视为学习算法在给定数据和参数空间上的实例化
  3. “分类”(classification) 任务:预测的是离散值
          -  二分类(binary classification): 预测的仅涉及两个类别——正类(positive class)+反类(negative class)
          -  多分类(multi-class classifiaction):预测的涉及多个类别
    "回归"(regression) 任务:预测的是连续值
    “聚类”(clustering):学习算法自动根据数据的内在规律对数据集进行划分形成若干个“簇”(cluster)
  4. 根据训练数据是否拥有标记信息,学习任务可大致分为:监督学习(supervised learning)和无监督学习(unsupervised learning)。分类和回归是前者的代表,聚类是后者的代表
  5. 评价所学得模型优劣的重要指标是其 “泛化”(generalization) 能力,即是否适用预新样本的能力。具有强泛化能力的模型能很好地适用于整个样本空间(训练集仅是该样本空间的一个很小的采样)。通常假设样本空间中全体样本服从一个未知“分布” D \mathcal D D,每个样本均独立地从该分布上采样获得,即彼此独立同分布(independent and identicallly distributed,简称 i . i . d i.i.d i.i.d)。一般而言,训练样本越多,我们得到的关于 D \mathcal D D的信息越多,这样就越有可能通过学习获得具有强泛化能力的模型

假设空间

由所有假设(hyothesis)所组成的空间称为假设空间,即可认为是未实例化的待学习的所有可能模型所组成的空间(即模型参数未确定)。通过学习得到的模型对应了假设空间中的一个假设(即模型参数确定)

  1. 科学推理的两大基本手段:
    • 归纳 (induction):从特殊到一般的“泛化”的过程,即从具体事实归结出一般性规律。“从样例中学习”是一个归纳的过程,因此亦称为“归纳学习”(induction learning),它具有狭义和广义之分,广义的归纳学习大体相当于从样例中学习,而狭义的归纳学习则要求从训练数据中学得概念(concept),因此亦称为“概念学习”或“概念形成”,其中最基本的便是布尔概念学习,即二分类学习
    • 演绎 (deduction):从一般到特殊的“泛化”过程,即从基础原理推演出具体状况
  2. 我们可以把学习过程视为一个在所有假设组成的空间中进行搜索的过程,搜索目标是找到与训练集“匹配”(fit)的假设,即能够将训练集预测正确的假设(即找到最优参数)。假设的表示一旦确定,假设空间及其规模大小就确定了。注意,显示中的假设空间通常会很大,但学习过程是基于有限样本训练集进行的,因此可能有多个假设与训练集一致,即存在一个与训练集一致的“假设集合”,称为“版本空间”(version space)

归纳偏好

用于解决“版本空间”问题。机器学习算法在学习过程中对某种类型假设的偏好,称为“归纳偏好”(inductive bias)或简称“偏好”。任何一个有效的机器学习算法必有其归纳偏好,否则它无法从“版本空间”中产生确定的学习结果。

归纳偏好可视为算法自身在一个可能很庞大的假设空间中对假设进行选择的启发或“价值观”,而“奥卡姆剃刀”(Occam’s razor)是一种常用的、自然科学中最基本的原则,即“若有多个假设与观察一致,则选择最简单的那个”。但需注意的是,它并非是唯一可行的原则。

事实上,归纳偏好对应了学习算法本身所做出的关于“什么样的模型更好”的假设。在具体的现实问题中,这个假设是否成立,即算法的归纳偏好是否与问题本身匹配,大多数时候直接决定了算法能否取得好的性能。需注意的是,不同的问题可能会有不同的归纳偏好。

NFL定理 (No Free Lunch Theorem):“没有免费的午餐”定理,即所有学习算法的期望性能都跟随机胡猜差不多。该定理的一个重要前提是:所有“问题”出现的机会相同、或所有问题同等重要。但实际情形并非如此。很多时候,我们只关注自己正在试图解决的问题,希望为它找到一个解决方案,至于该方案在别的问题、甚至相似的问题上是否为好方案,我们并不关心。NFL定理告诉我们,脱离具体问题,空泛地谈论“什么学习算法更好”毫无意义,因为若考虑所有潜在的问题,则所有学习算法都一样好。要谈论算法的相对优劣,必须要针对具体的学习问题,学习算法自身的归纳偏好与问题是否匹配,往往会起到决定性的作用

人工智能(AI)与机器学习(ML):塑造未来的技术引擎 人工智能是种模拟、延伸和扩展人类智能的理论、方法、技术及应用系统。它旨在让计算机能够像人类样思考、学习,并能在各种环境下自主地做出决策。AI的发展经历了从最初的符号主义、连接主义到如今的深度学习等多个阶段,每次的突破都极大地推动了科技的进步。尽管AI与ML技术取得了巨大的进步,但它们仍然面临着诸多挑战。首先,数据的获取和标注是个巨大的问题。高质量的标注数据是机器学习模型训练的关键,但数据的获取和标注往往需要耗费大量的人力和时间。其次,模型的泛化能力也是个需要解决的问题。 阅读详情

相关推荐

【AI】用iOS的ML(机器学习)创建自己的AI App

在机器学习中,切都始于模型,这是进行预测或识别的系统。教计算机学习涉及使用训练数据的机器学习算法进行学习。从训练中生成的输出通常称为机器学习模型。有不同类型的机器学习模型来解决同个问题(例如对象识别),但使用不同的算法。是其中些机器学习算法。

欧阳天涵的专栏 4859

ML.NET教程.pdf

ML.NET中文版详解

ML.NET 开发智能应用:让 .NET 程序员轻松掌握机器学习

ML.NET是个由微软开发的开源跨平台机器学习框架,专为 .NET 开发者设计,允许他们在不离开 C# 或 F# 编程语言的情况下,进行机器学习建模和应用。通过 ML.NET,开发者无需学习 Python 或深度学习框架的复杂操作,就能在其现有的 .NET 应用中集成强大的机器学习功能。ML.NET 支持各种机器学习任务,包括分类、回归、聚类、推荐、异常检测、自然语言处理等。无论是开发企业级应用、Web 应用,还是桌面应用,ML.NET 都能为你的项目带来智能化提升。

这里只有干货:从 Modbus 通信到 MES 对接,从 YOLO 训练到工控机部署,带你搞定工业软件开发全流程。 3143

李宏毅2020机器学习课程笔记)- 分类与回归

包含李宏毅机器学习视频P1-P16的课程梗概

1万+

系列ML.Net 学习篇【】——初识机器学习

微软官方的目的就是,让你无需离开 .NET 生态系统,便可以使用 C# 或 F# 创建自定义 ML 模型。并让你可以轻松地将机器学习集成到 Web、移动、桌面、游戏和物联网应用中。 所以如果你刚好有Python训练好的模型,而正在烦恼怎么应用到.NET平台上时,那么刚好可以使用ML.NET,使用你的模型,它基本兼容市面上所有常见的数据格式,ML.NET支持TensorFlow和ONNX模型。

网尘的技术专栏 5581

ML.NET 示例项目教程

ML.NET 是个跨平台的开源机器学习框架,旨在使机器学习对 .NET 开发者更加友好。该项目提供了丰富的示例代码,帮助开发者快速上手并集成机器学习到现有的或新的 .NET 应用程序中。 ## 项目快速启动 ### 环境准备 1. 安装 .NET SDK。 2. 克隆项目仓库: ```bash git clone https://github.com/dotnet/machin

gitblog_00041的博客 1266

ML.Net模型训练与使用基本流程

若要开始训练过程,需要向新的或现有的 .NET 应用程序添加新的机器学习模型 (ML.NET) 项。推荐使用类库(类库的个优点就是可移植性)。使用类库,可以轻松地从控制台、桌面、Web 和任何其他类型的 .NET 应用程序引用其中的任何模型。建议将机器学习模型 (ML.NET) 项添加到类库中。

滴水成河,汇流成海 1533

ML.NET革命性实战:从零打造预测模型

【代码】ML.NET革命性实战:从零打造预测模型。

墨夶的博客 949

ML.NET 机器学习实用指南(

机器学习(ML)在许多行业中得到广泛应用,如科学、医疗保健和研究,其受欢迎程度仍在不断增长。2018 年 3 月,微软推出了 ML.NET,以帮助.NET 爱好者与机器学习(ML)进行工作。通过这本书,你将探索如何使用 C#代码构建 ML.NET 应用程序,并使用各种 ML 模型。本书首先为你概述了机器学习和使用的 ML 算法类型,同时介绍了 ML.NET 是什么以及为什么需要它来构建 ML 应用程序。然后,你将探索 ML.NET 框架、其组件和 API。本书将作为本实用指南,帮助你使用 ML.NET 库

龙哥盟 2147

机器学习框架ML.NET学习笔记【1】基本概念系列文章目录

、序言 微软的机器学习框架于2018年5月出了0.1版本,2019年5月发布1.0版本。期间各版本之间差异(包括命名空间、方法等)还是比较大的,随着1.0版发布,应该是趋于稳定了。之前在园子里也看到不少相关介绍的文章,对我的学习提供了不少帮助。由于目前资料不是很丰富,所以学习过程中也走了不少弯路,本系列的文章主要记录我学习过程中的些心得体会,并对些细节会做详细的解释,希望能为...

weixin_30734435的博客 253

Spark 2.0 机器学习 ML 库:常见的机器学习模型(Scala 版)

、前言 机器学习中,人为地设计算法,需要定的知识积淀。 而使用别人设计好的机器学习库如 Spark 2.0 ML,那是基本不需要什么基础的,开箱即用。 首先,看个简单、完整、规范的案例,无疑是最好的方式。 之前的文章(内含短小精悍的案例): Spark 2.0 机器学习 ML 库:特征提取、转化、选取(Scala 版) Spark 2.0 机器学习 ML 库:机器学...

IT小村 1万+

MLMLOps系列讲解之《设计机器学习驱动的(ML-powered)软件—我们想要解决的业务问题是什么?》解读

MLMLOps系列讲解之《设计机器学习驱动的(ML-powered)软件—我们想要解决的业务问题是什么?》解读 导读:设计机器学习驱动的软件,这部分致力于任何软件项目中最重要的阶段之——理解业务问题和需求。 由于这些同样适用于基于 ML 的软件,因此您需要确保在开始设计之前有个很好的理解。 任何软件项目中最重要的阶段都是理解业务问题并创建需求。基于ML的软件在这里也不例外。最初的步骤包括对业务问题和需求的彻底研究。这些需求被转换成模型目标和模型输出。需要指定可能的错误和启动的最低成功率。继续研究A

头部AI社区如有邀博主AI主题演讲请私信—心比天高,仗剑走天涯,保持热爱,奔赴向梦想!低调,专注,谦虚,自律,反思,成长,还算比较正能量的博主,公益免费传播…内心特别想在AI界做出一些可以推进历史进程影响力的技术(兴趣使然,有点小情怀,也有点使命感呀 2706

Unity 机器学习(ML-Agents) 基础

Unity 机器学习 ML-Agents 基础Unity 官方示例下载ML-Agents 部分Python 下载AnacondaAnaconda 虚拟环境构建 ML-Agents安装 ML-Agents Python 包安装 ML-Agents 包ML-Agents 入门指南Unity Hub 部分虚拟环境 训练虚拟环境 训练运行:虚拟环境 开始训练:虚拟环境 观察训练进度:虚拟环境 停止训练虚拟环境 恢复训练虚拟环境 训练模型ML-Agents 打造新的学习环境ML-Agents 资产导入 Unity 官

Maddie_Mo的博客 1万+

ML基本概念

李宏毅老师的新课上起来是醍醐灌顶的程度,而且很新! 帮助我看懂了令人发愁的论文,您就是我的恩人! 会以虔诚的心好好学习的,ღ( ´・ᴗ・` )比心 什么是机器学习 机器学习是什么,让机器具备个找函数的能力。如语音辨识(函数输入语音,可以输出文字)影像辨识(函数输入图片,输出文字)下棋(函数输入当前的棋子位置,输出下步的位置) 机器学习的任务: regression回归:是指要找的函数输出是个scaler数值 classification分类:事先准备好的选项中得到输出,AlphaGo也是

云淡风轻_的博客 3079

在 Azure ML 上用 .NET 跑机器学习

.NET ML 你在用了吗?

Kinfey 3721

MLMLOps系列讲解之《CRISP-ML (Q)ML生命周期过程—了解机器学习开发的标准过程模型—业务和数据理解→数据工程(数据准备)→ML模型工程→评估ML模型→模型部署→模型监控和维护》解读

MLMLOps系列讲解之《CRISP-ML (Q)ML生命周期过程—了解机器学习开发的标准过程模型—业务和数据理解→数据工程(数据准备)→ML模型工程→评估ML模型→模型部署→模型监控和维护》解读 目录 MLOps系列讲解之《CRISP-ML (Q)ML生命周期过程—了解机器学习开发的标准过程模型》解读 6、CRISP-ML (Q)ML生命周期过程—了解机器学习开发的标准过程模型。 6.1、Business and Data Understanding业务和数据理解 6.2、Data Eng

头部AI社区如有邀博主AI主题演讲请私信—心比天高,仗剑走天涯,保持热爱,奔赴向梦想!低调,专注,谦虚,自律,反思,成长,还算比较正能量的博主,公益免费传播…内心特别想在AI界做出一些可以推进历史进程影响力的技术(兴趣使然,有点小情怀,也有点使命感呀 2899

ML.NET与C#在Jupyter笔记本中的应用:机器学习实践教程

ML.NET 是个跨平台的开源机器学习框架,由微软开发,旨在将机器学习的能力带给.NET开发者。开发者可以使用C#或F#等.NET支持的语言,轻松地将机器学习模型集成到应用程序中,无论是Web、移动还是桌面应用。ML.NET允许开发者从数据准备、模型训练、评估、优化到最终的模型部署,整个机器学习工作流全部在.NET环境中完成。随着人工智能和机器学习技术的快速发展,ML.NET框架的设计初衷是为了解决.NET开发者在构建智能应用程序时面临的挑战。

weixin_33750664的博客 1201

机器学习笔记基本概念

并不是为了得到最后的运算结果,而是。

qq_47343046的博客 1057
上一篇: GANs入门系列三
下一篇: DL中常用的三种K-Lipschitz技术
chenhch8
博客等级 码龄9年 35粉丝 31原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值