个人笔记--使用sklearn库构建机器学习模型,并使用模型预测

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情
   sklearn是一个机器学习的python库,里面包含很多经典的算法,可以很方便的选择对应的算法对数据进行训练,很方便的得出各种训练的参数,并使用模型对分类进行预测。
    总的来说一般机器学习分如下步骤    获取数据——》数据预处理——》训练模型——》模型评估——》预测
    鸢尾花识别是一个经典的机器学习分类问题,它的数据样本中包括了4个特征变量,1个类别变量,样本总数为150。首先对数据进行分类,一部分用来训练模型,另一部分用来进行评估,当评估结果达到满意度时将对未知分类进行预测。
    一.数据获取
    sklearn内置很多经典案例的数据,也可以自建数据,数据导入都以矩阵形式输入。

点击(此处)折叠或打开

  1. #导入数据集合,里面包含相当丰富的经典案例数据集
  2. from sklearn import datasets
  3. iris_data = datasets.load_iris()  # 导入鸢尾花识别数据
  4. X_train = iris_data.data          # 特征集合
  5. y_train = iris_data.target        # 分类结果集   

   二.数据预处理
   这部主要目的是要把数据分为测试集和训练集,理论上训练集数据越多,得出的模型越准确,但是也需要大量的测试数据进行验证,这里按照 3:7 比例
   

点击(此处)折叠或打开

  1. from sklearn.model_selection import train_test_split #导入分类工具
  2. #测试集占比0.3,分别得出训练集的数据和测试集的数据
  3. X_train,X_test,y_train,y_test=train_test_split(iris_X,iris_y,test_size=0.3)

   三.训练模型
   使用训练集数据进行模型训练,这里的难点个人看来是选择合适的算法,这是要基于深厚的数学功底,各种算法的使用请移步官网( https://sklearn.apachecn.org/docs/0.21.3/),本人数学都还给老师了,近期在充电。
   

点击(此处)折叠或打开

  1. # 邻近点方式训练数据
  2. from sklearn.neighbors import KNeighborsClassifier
  3. # 引入训练方法
  4. knn = KNeighborsClassifier()
  5. # 使用训练数据集训练,第一个参数是特征值,第二个是分类值
  6. knn.fit(X_train,y_train)
        # 查看模型的相关信息
        knn.get_params()

    四. 模型评估
    当模型已经训练出来了就要对模型进行评估是否达到了要求,这时候就要使用测试数据进行评估
    

点击(此处)折叠或打开

  1. # 进行评估, 一般得出的结果是一个百分比,代笔预测的准确度,越接近1表示准确度越高,如果准确度很低或许考虑换 算法或者更换训练数据
  2. score = knn.score(X_test,y_test)
    五.预测
    前面做了那么多最终都是为了这一步,收获果实的一步。当第四步得出的评估满足要求时就可以使用这个模型对新的样本进行预测。
   

点击(此处)折叠或打开

  1. # 这里使用测试集进行数据预测,也可以自己定义数据
  2. y_test_ = knn.predict(X_test)
       y_test_就是使用模型预测得出的结果集
       可以跟真实测试集结果进行比对 计算出损失度
       from sklearn.metrics import log_loss
       loss = log_loss(y_test,y_test_)  # 第一个真实数据,第二个为模型预测数据

     这是一个简单的机器学习建模和使用过程,传统的机器学习算法模型都是基于概率论,预测的结果也是基于最大概率,在现实世界中往往比较客观,对于数据集要求比较高,对于算法理解也很高,所以在现实世界中准确率不高。
    当前人工智能中比较或的一个分支---深度学习 通过训练能提供比较准确的模型,深度学习是模拟人的神经网络传输,使用多层神经网络进行建模,将特征进行更细化,本人正在初入此门课程,也在学习这方面的资料,学习数学算法,本文是个人学习的一个笔记。
    很多内容引用自https://www.cnblogs.com/wj-1314/p/10179741.html





   
使用sklearn 神经网络训练模型 使用sklearn中神经网络模型对数据集进行训练和验证。 数据见本人博客“随机森林模型预测和交叉验证“ Neural Network trainning >>> from sklearn.model_selection import train_test_split >>> from sklearn.model_selection import cross_va... 阅读详情

相关推荐

机器学习sklearn】基于sklearn的股票预测

最近了解学习数据统计,了解到了python的sklearn这个,集成了很多机器学习模型,感觉很强大,官网 下面通过一个简单的预测的例子来上手sklearn这个。 根据pythonprogramming上的例子改写。本次实验使用anaconda的集成环境,故不需要下载所需的包,但需要使用conda命令更新sklearn至官网教程所使用的版本(之前因为版本问题纠结了好久)。如果没有使用anac

u012315428的专栏 1万+

机器学习 —— 感知机简单入门

机器学习 —— 感知机简单入门第1关:感知机 - 西瓜好坏自动识别1. 感知机原理简介1.1 举例1.2 数学原理/公式1.3 算法流程实现代码第2关:scikit-learn感知机实践 - 癌细胞精准识别1. 数据集介绍及使用2. 使用 sklearn.Perceptron 方法实现感知机算法3.题目编程要求4. 实现代码sklearn.Perceptron方法详述参数提及 第1关:感知机 - 西瓜好坏自动识别 1. 感知机原理简介 1.1 举例 这里,我们利用西瓜书上的例子来构造数据,实例中包括特征和

HALF愚笨角 3957

机器学习模型(sklearn)

机器学习模型的作用是自动从数据中学习提取有用的信息,以做出预测或决策。在监督学习中,模型通过识别特征与输出之间的关联来预测结果,如将邮件分类为垃圾邮件或非垃圾邮件。无监督学习中,模型探索数据的内在结构,如通过聚类分析市场细分。强化学习模型通过与环境的互动学习最佳行动策略。机器学习模型的应用广泛,如自动驾驶车辆的路径规划、股市趋势的预测以及个性化推荐系统等。这些模型使计算机能够处理复杂问题,无需显式编程即可适应新情况,推动了人工智能的发展。在机器学习中,模型是算法的核心,负责从数据中学习规律和做出预测

2303_76972906的博客 2777

机器学习:8.机器学习-线性回归

第1关:简单线性回归与多元线性回归 1、下面属于多元线性回归的是? A、求得正方形面积与对角线之间的关系。 B、建立股票价格与成交量、换手率等因素之间的线性关系。 C、建立西瓜价格与西瓜大小、西瓜产地、甜度等因素之间的线性关系。 D、建立西瓜书销量与时间之间的线性关系。 B C 2、若线性回归方程得到多个解,下面哪些方法能够解决此问题? A、获取更多的训练样本 B、选取样本有效的特征,使样本数量大于特征数 C、加入正则化项 D、不考虑偏置项b A B C 3、下列关于线性回归分析中的残差(预测值减去真实

qq_45795586的博客 8431

机器学习 | sklearn

本篇文章主要讲解对所给数据集进行机器学习之前的样本划分、数据预处理、数据降维等知识点与可视化和python实现

天下弈星~的博客 2392

勾八头歌之分类回归聚类

第10关sklearn中的分类性能指标。前面四个时必须写的其他等我闲了再写。第1关简单线性回归与多元线性回归。第2关逻辑回归的损失函数。第1关逻辑回归核心思想。四、聚类性能评估指标。

m0_62470904的博客 3058

机器学习基础 3】 sklearn

Scikit-learn(简称sklearn)是一个用于机器学习的Python,它包含了许多常用的机器学习算法、预处理技术、模型选择和评估工具等,可以方便地进行数据挖掘和数据分析。Scikit-learn建立在NumPy、SciPy和Matplotlib之上。

yewanyuan的博客 1万+

pyspark调用sklearn训练好的模型预测以及spark.ml训练预测

1.首先用sklearn 生成简单的LR模型保存本地。 import joblib import pandas as pd from sklearn.datasets import make_blobs from sklearn.linear_model import LogisticRegression from sklearn.model_selection import train_test_split from sklearn.metrics import roc_auc_score #

人生百态361 6059

[个人笔记]机器学习模型代码审计 - 以Python的sklearn中的SVM模型预测股价为例

机器学习

m0_60879685的博客 1107

Python的机器学习Sklearn

其中,Scikit-learn(简称Sklearn)作为Python中最受欢迎和广泛使用机器学习之一,提供了丰富的功能和算法,帮助用户快速实现各种机器学习任务。3. 完善的文档和示例:Sklearn提供了详细的文档和示例,帮助用户理解和使用中的功能和算法。2. 丰富的功能和算法:Sklearn提供了丰富的机器学习功能和算法,包括监督学习、无监督学习、特征工程和模型评估等。2. 图像识别:使用Sklearn提供的特征选择和分类算法,可以实现对图像数据的识别和分类,如人脸识别和图像标注等。

m0_70911440的博客 3002

Python中机器学习神器——sklearn模块

参考文章 Python机器学习笔记sklearn的学习 ML神器:sklearn的快速使用 机器学习Sklearn的初识 传统的机器学习任务从开始到建模的一般流程是:获取数据 → 数据预处理 → 训练建模 → 模型评估 → 预测,分类。 Skikit-learn算法 由图中,可以看到的算法主要有四类:分类,回归,聚类,降维。其中: 常用的回归:线性、决策树、SVM、KNN ; 常用的分类:线性、决策树、SVM、KNN,朴素贝叶斯; 既可以回归也可以分类的算法:随机森林、Adaboost、Gr

Fo*(Bi)的博客 8457

python-sklearn学习笔记(一):训练模型使用预测数据的导出

这几天在机器学习中对sklearn引入数据,拆分数据,训练数据,测试数据,导出模型都有了一个大概的了解 但是对于导出的模型如何去进行使用,让我产生了一些疑惑, 当我解决这些疑问后,我发现是由于没有pandas的使用基础才导致了这些疑惑, 所以建议小伙伴在学习sklearn之前,要能对pandas的使用有一个基本的了解 这里讲一下我是怎么实现训练模型的导出和导入预测数据将数据显示在原数据集...

小火车的博客 3万+

机器学习入门之糖尿病预测——ML-sklearn

从网上找到一处实例,跟着先把机器学习的数据分析的流程先了解一遍,把此实例的每一步理解记录一下。 数据集下载链接:https://github.com/susanli2016/Machine-Learning-with-Python/blob/master/diabetes.csv 一步步慢慢理解ML-sklearn from warnings import simplefilter simple...

学而不思则忘 2万+

用python+sklearn(机器学习)实现天气预报数据 模型使用

用python+sklearn机器学习实现天气预报 模型使用项目地址系列教程0.前言1.建立模型a.准备引入所需要的头文件选择模型选择评估方法获取数据集b.建立模型c.获取模型评估结果d.用joblib模块保存模型e.封装2.总控代码使用方法 项目地址 github项目:PYWeatherReport 系列教程 机器学习参考篇: python+sklearn+kaggle机器学习 用python+sklearn(机器学习)实现天气预报数据 数据 用python+sklearn(机器学习)实现天气预报 准备

Eritque arcus的博客 1万+

使用sklearn进行在线实时预测构建可用模型

前面说到的运行方式是在离线环境中运行,在真实世界中,我们很多时候需要在线实时预测,一种解决方案是将模型服务化,在我们这个场景就是,我告诉你一个鸢尾花的 sepal_length, sepal_width, petal_length, petal_width 之后,你能够快速告诉我这个鸢尾花的类型,借助 flask 等 web 框架,开发一个 web service,实现实时预测。上面的模型对鸢尾花数据进行训练生成一个模型,之后该模型对测试数据进行预测预测结果为每条数据属于哪种类别。

TURING.DT 3422

Sklearn 机器学习 房价预估 使用GBDT训练模型

使用 Sklearn 中的 GBDT 模型进行房价预测的方法。

Kant2048的博客 1448

Python机器学习——Sklearn

目录 简介 常规使用模式 sklearn中的数据展示 sklearn model中常用属性与功能 数据标准化 交叉验证 过拟合问题 保存模型 小结 简介 Scikit-learn(sklearn)是机器学习中常用的第三方模块,对常用的机器学习方法进行了封装,包括回归(Regression)、降维(Dimensionality Reduction)、分类(Classfi...

韩明宇 7486

机器学习之Python — Sklearn简介

文章目录机器学习之Python — Sklearn简介1 Sklearn简介2 Sklearn安装3 Sklearn datasets4 Sklearn通用学习模式5 Sklearn数据预处理 – 标准化6 Sklearn交叉验证7 总结参考资料 机器学习之Python — Sklearn简介 1 Sklearn简介 Scikit-learn(sklearn)是机器学习中常用的第三方模块,对常...

weixin_42181072的博客 2373

Python机器学习▶线性回归——基于sklearn建立房价预测模型

1. 数据理解 此次建模预测的数据集来源于Data Castle上的“美国King County房价预测训练赛”,链接如下: 数据特征描述如下: 测试集主要包括3000条记录,13个字段,跟训练集的不同是测试集不包括房屋销售价格,通过由训练集所建立的模型以及所给的测试集,得出测试集相应的房屋销售价格预测值。 2.数据准备 环境:win7+Anaconda+Jupyter notebook 导入数据 import pandas as pd import numpy as n...

爬遍所有网站 3235
上一篇: 记录linux升级gcc导致的故障
下一篇: django+celery 定时任务
body221
博客等级 码龄15年 4粉丝 63原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值