登录社区云,与社区用户共同成长
邀请您加入社区
思路比赛的时候愣是用map< string, int>的值代表了这个人所处家谱中的层次后来借鉴了小明学长的思路, 给每个人编id号, 用值表示每个对应的id用fa[maxn]存的是每个人的父亲id, fa[id] = 父亲的id有一个小问题, AC之后想关闭IO同步提一波速, 没料到PTA很玄学地...
一、引言所谓数据挖掘,就是从大量无序的数据中发现隐含的、有效的、有价值的、可理解的模式,进而发现有用的知识,并得出时间的趋向和关联,为用户提供问题求解层次的决策支持能力。二、 DM中的现有的聚类算法本文以聚类算法所采用的基本思想为依据将它们分为五类,即层次聚类算法、分割聚类算法、基于约束的聚类算法、机器学习中的聚类算法以及用于高维数据的聚类算法。...
快速寻找最优解 -基础知识通过上文, 我们知道了, 如果盲目使用随机算法或者遍历算法寻找最优解的话, 需要计算的空间将会太大. 为了能够让大家直观的感受一下实际应用的计算量, 我这里再举个例子, 1997年5月11日 IBM的深蓝AI战胜卡国际象棋名家斯帕罗夫. 我们知道 围棋的棋盘是19路总共361格, 如果计算机需要计算10步则需要计算的状态数量为361^10 = 37589...
Numpynumpy是数值计算最重要的基础包,几乎所有的科学运算的模块底层所用的都是numpy数组。Numpy本身没有提供多么高级的数据分析功能,他所提供的功能主要是:1.具有矢量算术运算(用数组表达式代替循环的做法通常称为矢量化),矢量化计算因为不使用循环,因此速度会快1到两个数量级2.广播。(不同大小的数组之间的运算)3.提供了对整组数据进行快速运算的标准函...
cs229学习问题notes3 Support Vector Machines21、如何用机器学习对单个股票下一个交易日涨跌进行预测?解答:如果用日数据,找到三个因子,学习一个model,用前一个交易日的三个因子数据预测下一个涨跌,数据标准化后都变为0,该怎么办?20、策略回测时用指数来对冲,实际交易过程中用指数期货来交易,这样是否可行?是否应该用指数期货来回测?...
第10章隐马尔可夫模型隐马尔可夫模型(hidden Markov model, HMM)是可用于标注问题的统计学习模型,描述由隐藏的马尔可夫链随机生成观测序列的过程,属于生成模型。10.1 隐马尔可夫模型的基本概念定义10.1 (隐马尔可夫模型) 隐马尔可夫模型是关于时序的概率模型,描述由一个隐藏的马尔可夫链随机生成不可观测的状态随机序列,再由各个状态生成一个观测而产生观测随...
一、引言 哈喽大家好,今天要给大家讲的是“遗传算法”。跟粒子群算法、蚁群算法一样,遗传算法也是属于启发式算法,它基于达尔文的进化论,模拟进化论中的“自然选择,物竞天择、适者生存”,通过N代的遗传、变异、交叉、复制,进化出问题的最优解。二、浅谈生物学2.1 达尔文教你进化论 学过初中生物的应该都知道达尔文的进化论。总结起来其实就是“物竞天择、适者生存”。这是什么意思呢...
目录:Python基础:Python基本用法:控制语句、函数、文件读写等Python基本数据结构:字典、集合等Numpy:简述Pandas:简述一、 Python基础:1.1 文件读取1).打开文件2).操作数据(读、写)3).关闭文件**打开文件:fp = open(path, 打开方式, encoding...
最新在一个项目中要求用到微软SSAS中的数据挖掘功能,虽然以前做项目的时候也经常用到SSAS中的多维数据集(就是CUBE),但是始终没有对SSAS中的数据挖掘功能进行过了解。所以借着项目需求这股东风最近了解了下SSAS的数据挖掘,这里先写一篇博客做一个简要的归纳。说到数据挖掘,我们首先需要知道SSAS数据挖掘能干什么,为什么需要进行数据挖掘。我们先来看一个例子假设我们数据库中...
第一章 统计学习方法概论统计学习的主要特点是:(1)统计学习以计算机及网络为平台,是建立在计算机及网络之上的;(2)统计学习以数据为研究对象,是数据驱动的学科;(3)统计学习的目的是对数据进行预测与分析;(4)统计学习以方法为中心,统计学习方法构建模型并应用模型进行预测与分析;(5)统计学习是概率论、统计学、信息论、计...
概述numpynumpy(numeric python)是 python 的一个开源数值计算库,主要用于数组和矩阵计算。底层是 C 语言,运行效率远高于纯 python 代码。numpy主要包含2个重要的数据类型:1)ndarray (N维数组,这个是我们要重点掌握的)2)matrix (矩阵)scipyscipy 是基于 numpy 的的一个算法库和数学工具包,包含的模块有...
3D图形学的学习策略1.以我现在的水平观之,3D图形学分3大块的学习内容:a.空间几何数学:空间几何变换,加速算法,多边形技术,曲线和曲面,相交测试,碰撞测试。b.光照着色系统:光照,纹理贴图,高级象素着色光照,艺术性渲染.c.程序技术性应用:公告板,精灵,天空盒,体绘制,材质系统,场景图,渲染队列.2.在实际学习过程中,3个部分相互制约,故不能单方面突进,应保持一种平衡发展,使得相互...
上周在极客时间偶然看到陈旸博士的关于数据分析的课程,觉得很不错,便毫不犹豫的花钱买了这个课程,今天抽空看了实战分析第二讲,感触最深的就是学习过程一定要做笔记,不仅能锻炼自己的归纳总结能力,更能对这一讲的东西进行回顾,还能时不时回头看看当初的想法。所以,我也试着开始做些笔记,毕竟大神都是这么过来的,好了,话不多说,进入今天的正题:数据分析全景图及修炼指南。 该讲主要引导读者...
数据挖掘大部分的价值在于利用数据挖掘技术改善预测模型。知识发现KD输出的是规则数据挖掘DM输出的是模型共同点两种方法输入的都是学习集(learning sets)目的都是尽可能多的自动化数据挖掘过程只能半自动化,不能完全自动化社会信息化后,社会的运转是软件的运转,社会的历史是数据的历史技术分类预言:用历史预测未来描述:了解数据中潜在的规律数据挖掘技术关联分析序列模式分...
一、简单线性回归模型举例汽车卖家做电视广告数量与卖出去的汽车数量:1.1 列出适合简单线性回归模型的最佳回归线?使sum of squares最小1.2 计算1.3 预测假设有一周的广告数为6.预测的汽车销售量为多少?代码:# -*- coding:utf-8 -*-#简单线性回归...
一元线性回归模型样本数量m 输入变量x 输出变量y 训练样本(x,y) 第i个训练样本(,)假设函数: 模型参数代价函数:优化目标:算法:1.梯度下降法具体解法:2.正规方程法转载于:htt...
数据挖掘领域十大经典算法初探译者:July 二零一一年一月十五日-----------------------------------------参考文献:国际权威的学术组织ICDM,于06年12月年评选出的数据挖掘领域的十大经典算法:C4.5, k-Means, SVM, Apriori, EM, PageRank, AdaBoost, kNN, Naive ...
上一篇通过公式自己写了一个计算两组数据的皮尔逊积矩相关系数(Pearson's r)的方法,但np已经提供了一个用于计算皮尔逊积矩相关系数(Pearson's r)的方法np.corrcoef():a = pd.Series([1,2,3,4,5,6,7,8,9,10])b = pd.Series([2,4,1,5,1,3,6,2,7,0])c = pd.Series...
一、基础理解问题:逻辑回归算法是用回归的方式解决分类的问题,而且只可以解决二分类问题;方案:可以通过改造,使得逻辑回归算法可以解决多分类问题;改造方法:OvR(One vs Rest),一对剩余的意思,有时候也称它为 OvA(One vs All);一般使用 OvR,更标准;OvO(One vs One),一对一的意思;改造方法不是指针对逻辑...
案例来源:《Python数据分析与挖掘实战》第6章案例背景与挖掘目标提取窃漏电用户的关键特征,构建窃漏电用户的识别模型,自动检查、判断用户是否存在窃漏电行为。输入数据:用电负荷数据终端报警信息违约、窃电处理通知书挖掘目标:归纳出窃漏电用户的关键特征,构建窃漏电用户的识别模型利用实时监测数据,调用窃漏电用户识别模型实现实时诊断分析方法与过程(选择的原则)数据预处理...
import numpy as npfrom sklearn import datasetsimport matplotlib.pyplot as plt%matplotlib inlinediabetes = datasets.load_diabetesprint(type(diabetes))print(diabetes.data.shape)...
# 注:使用线性回归算法的前提是,假设数据存在线性关系,如果最后求得的准确度R < 0,则说明很可能数据间不存在任何线性关系(也可能是算法中间出现错误),此时就要检查算法或者考虑使用其它算法;一、功能与特点 1)解决回归问题 2)思想简单,实现容易 # 因为算法运用了很多的数学推到,使计算机实现变得容易 3)许多非线性模型的基础 4)结果具有很好的可解释...
1.最小二乘法解的的推导,几何意义解释最小二乘法2.从概率的角度解释最小二乘法结论:最小二乘法等价于最大似然估计(条件是噪音需要满足高斯分布)3. L2正则化 --- 岭回归因为最小二乘法任意过拟合,所以引入了正则化。Ridge:假设先验满足高斯分布,使用L2正则化(权重衰减)Lasso:假设先验满足laplace分布,使用L1正则化...
在实际的聚类应用中,通常使用k-均值和k-中心化算法来进行聚类分析,这两种算法都需要输入簇数,为了保证聚类的质量,应该首先确定最佳的簇数,并使用轮廓系数来评估聚类的结果。一,k-均值法确定最佳的簇数通常情况下,使用肘方法(elbow)以确定聚类的最佳的簇数,肘方法之所以是有效的,是基于以下观察:增加簇数有助于降低每个簇的簇内方差之和,给定k>0,计算簇内方差和var(k),...
趁着还未工作,先把过去做的东西整理下出来~Github源码:https://github.com/Blz-Galaxy/OpenCV-Face-Recognition(涉及个人隐私,源码不包含测试样本,请谅解~)对实验结果更感兴趣的朋友请直接看 第5章【摘要】这是一篇关于人脸识别方法的实验报告。报告首先回顾了人脸识别研究的发展历程及基本分类;随后对人脸...
移动这一简单动作,对于人类来说相当容易,但对机器人而言就变得极为复杂,说到机器人移动就不得不提到路径规划,路径规划是移动机器人导航最基本的环节,指的是机器人在有障碍物的工作环境中,如何找到一条从起点到终点适当的...
利用kmeans算法,将彩色图像的像素点作为样本,rgb值作为样本的属性,对图像所有的像素点进行分类,从而实现对图像中目标的分割。c++代码(openCV 2.4.11)Scalar colorTab[] = {Scalar(0, 0, 0),Scalar(255, 255, 255),};void color_cluster(const Mat& ...
网址:https://www.bilibili.com/video/av50747658/ (b站找的有中文字幕的视频)第一周一、引言1.1 欢迎1.2 机器学习是什么1.3 监督学习1.4 无监督学习二、单变量线性回归2.1 模型表示2.2 代价函数2.3 代价函数的直观理解 I2.4 代价函数的直观理解 II2.5 梯度下降2.6 ...
本文作为数据挖掘技术的入门篇,部分整理,待完善,增加数据挖掘算法深入&应用等内容....[@more@]一、数据挖掘过程1、数据抽样(1)从企业数据中精选用于数据挖掘的样本(2)数据取样时要严把质量关(3)抽样数据必须在...
人工智能时代正朝我们快步走来,将全面影响我们生活的方方面面,近年来,沉浸已久的扫地机器人也迎来了爆发式增长,除了消费升级与懒人时代的到来,技术升级也是促使扫地机器人市场爆发的重要因素。扫地机器人的技术升级之路...
GM(1,1).m%建立符号变量a(发展系数)和b(灰作用量)syms a b;c = [a b]';%原始数列 AA = [174, 179, 183, 189, 207, 234, 220.5, 256, 270, 285];%填入已有的数据列!n = length(A);%对原始数列 A 做累加得到数列 BB = cumsum(A);...
图像分割是计算计视觉研究中的经典难题,已成为图像理解领域关注的一个热点, 图像分割作为图像技术领域的一个经典难题,自上世纪七十年代以来吸引了众多研究人员的研究热情并为之付出了巨大努力,提出了很多图像分割算法。这些分割算法分割性能的优劣,是用相关图像分割质量测度来进行评价的。但由于对算法分割是否成功的客观判定标准至今未得到解决,因此图像分割算法分割质量得评价成为一项颇具研究意义的课题...
欢迎大家前往腾讯云社区,获取更多腾讯海量技术实践干货哦~导语:本文是对机器学习算法的一个概览,以及个人的学习小结。通过阅读本文,可以快速地对机器学习算法有一个比较清晰的了解。本文承诺不会出现任何数学公式及推导,适合茶余饭后轻松阅读,希望能让读者比较舒适地获取到一点有用的东西。引言本文是对机器学习算法的一个概览,以及个人的学习小结。通过阅读本文,可以快速地对机器学习算...
贝叶斯分类器贝叶斯决策论贝叶斯决策论是概率框架下实施决策的基本方法。假设有N中可能的类别标记,即Y={c1,c2,...,cN},λij\mathcal{Y}=\{c_1, c_2,...,c_N\}, \lambda_{ij}Y={c1,c2,...,cN},λij是将一个真实标记的cjc_jcj的样本误分类成cic_ic...
1.概述 hash join是一种数据库在进行多表连接时的处理算法,对于多表连接还有两种比较常用的方式:sort merge-join 和 nested loop。 为了比较清楚的介绍hash join的使用场景以及为何要引入这样一种连接算法,这里也会顺带简单介绍一下上面提到的两种join方式。 连接方式是一个什么样的概念,或者说我们为何要有而且有好几种,对于不太了解数据库的人来讲可能...
感知机(perceptron) 是二类分类的线性分类模型,其输入为实例的特征向量,输出为实例的类别,取+1和-1二值.感知机对应于输入空间(特征空间) 中将实例划分为正负两类的分离超平面,属于判别模型.感知机学习旨在求出将训练数据进行线性划分的分离超平面,为此,导入基于误分类的损失函数,利用梯度下降法对损失函数进行极小化,求得感知机模型.感知机学习算法具有简单而易于实现的优点,分为原始...
1.感知器的介绍2.感知器的算法3.感知器的更新规则4.感知器的收敛性5.感知器的局限性6.参考文献1. 感知器的介绍感知器学习算法(PLA:Perception Learning Algorithm)是1957年提出的算法,比svm要早,实际上他是一种二分类问题的超平面(超平面是比实际维数低一维的集合,可以理解为这个集合的正交补空间的维数为1),一旦我们...
课程链接:生物信息学: 导论与方法1 导论与历史1.1 1-1 什么是生物信息学1.2 1-2 生物信息学历史1.3 1-3 中国大陆的生物信息学2 序列比对2.1 2-1 序列比对中的基本概念2.2 2-2 利用动态规划进行全局比对2.3 2-3 从全局比对到局部比对2.4 2-4 考虑仿...
一、概念数据模型概述数据模型是现实世界中数据特征的抽象。数据模型应该满足三个方面的要求:1)能够比较真实地模拟现实世界2)容易为人所理解3)便于计算机实现概念数据模型也称信息模型,它以实体-联系(Entity-RelationShip,简称E-R)理论为基础,并对这一理论进行了扩充。它从用户的观点出发对信息进行建模,主要用于数据库的概念级设计。通常人们先将现实世界抽...
Sigmoid函数是机器学习中比较常用的一个函数,在逻辑回归、人工神经网络中有着广泛的应用,Sigmoid函数是一个有着优美S形曲线的数学函数。Sigmoid函数的表达式:$$ f(x) = \frac{1}{1+e^{-x}} $$Sigmoid函数的图像:在上图可以看出,Sigmoid函数连续,光滑,严格单调,是一个非常良好的阈值函数。当x趋近负无穷时,y趋近于0;趋近于正...
用Bagging,以决策树为树桩,在西瓜数据集上实现。#!/usr/bin/python# -*- coding:utf-8 -*-import numpy as npimport matplotlib.pyplot as pltfrom sklearn.ensemble import BaggingClassifierfrom sklearn.tree imp...
这几天看了看PCA及其人脸识别的流程,并在网络上搜相应的python代码,有,但代码质量不好,于是自己就重新写了下,对于att_faces数据集的识别率能达到92.5%~98.0%(40种类型,每种随机选5张训练,5张识别),全部代码如下,不到50行哦。# -*- coding: utf-8 -*-import numpy as npimport os, glob, ra...
初面:面试官问的比较详细,对着简历上的内容逐个进行提问,其中涉及到的知识点主要包括SVM如何如何预测时间序列,以及K-mean聚类问题如何解决人为规定某两个物体强行归为一类的问题,以及简单的涉及随机森林的知识点,以及随机森林都有哪些参数,如何调参的思路;面试的特点也是集中在生物这一方面(聚类和决策树),毕竟是基因分析相关的内容。复面:面试官比较随和,不过摸不清他的套路...
2018/12/11开始阅读,2019/1月14日完成正常页3min/per_page, 有难度页5min/per_page正常每天1-1.5小时阅读。共计耗时36小时。同期开始学习Python(目前至递归函数)学习笔记大纲:第20章 指数第19章 质量管理的统计方法第18章 非参数方法第17章 时间序列分析及预测第16章 回归分析:建立模型第15章 多元回...
机器学习算法·决策树和朴素贝叶斯算法一、问题描述 1912年当时世界上体积最庞大,内部设施最豪华的客运轮船’泰坦尼克号’,拥有美誉‘永不沉没’。然而在第一次下水穿越大西洋时,就在航行中撞上冰山,永远沉没海底。船上丧生者达到1500多人。假如我们穿越时空回到了过去,成为船上的一名普通乘客,那么我们有多大的存活率?试根据船上乘客的各种信息特征来预测一下生存率。二、数据准备与预处理...
数据分析:是把隐藏在一些看似杂乱无章的数据背后的信息提炼出来,总结出所研究对象的内在归路一.NumPyNumPy是python语言的一个扩展程序库,支持大量的纬度数组和矩阵运算,此外也针对数组运算提供了大量的数学函数库1.创建ndarray(数组)(1)一维数组创建import numpy as npnp.array([1,2,3,4,5])(2)二维数组的创建impo...
—简介——脸部建模一直是计算机图像和视觉领域的热门话题,每个人脸模型的网格顶点个数各不相同,也就是拓扑结构不同。因此我们需要对我们的训练数据,做一个归一化处理。这里以世纪晟科技构建的一个快速的、交互的、基于深度学习的人脸建模框架为基础,展示级联形状回归模型在特征点定位任务上取得了重大突破。——级联线性回归模型——近来,级联形状回归模型在特征点定位任务上取得了重大突破,该方法使用回归模型...
本篇文章同样是继续微软系列挖掘算法总结,前几篇主要是基于状态离散值或连续值进行推测和预测,所用的算法主要是三种:Microsoft决策树分析算法、Microsoft聚类分析算法、Microsoft Naive Bayes 算法,当然后续还补充了一篇结果预测篇, 所涉及的应用场景在前几篇文章中也有介绍,有兴趣的同学可以点击查看,本篇我们将总结的算法为Microsoft时序算法,此算法也是数据挖掘算法
chapter-1监督学习:分类,回归无监督学习:聚类泛化能力:具有强泛化能力的模型能很好地适用与整个样本空间。NFL定理(没有免费的午餐定理):总误差与学习算法无关,任意两个学习算法,他们的期望性相同。即学习算法的期望性跟随机胡猜差不多。要具体问题具体分析,谈论算法的优劣,必须针对具体的学习问题。统计学习:支持向量机(SVM),核方法(kernel methods)数据挖掘(data min..
在听到人们谈论机器学习的时候,你是不是对它的涵义只有几个模糊的认识呢?你是不是已经厌倦了在和同事交谈时只能一直点头?让我们改变一下吧!本指南的读者对象是所有对机器学习有求知欲但却不知道如何开头的朋友。我猜很多人已经读过了“机器学习”的维基百科词条,倍感挫折,以为没人能给出一个高层次的解释。本文就是你们想要的东西。本文目标在于平易近人,这意味着文中有大量的概括。但是谁在乎这些呢?只要能让读者...