<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>生活 on Coder_Studio</title>
        <link>https://iamxurulin.github.io/tags/%E7%94%9F%E6%B4%BB/</link>
        <description>Recent content in 生活 on Coder_Studio</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <copyright>iamxurulin</copyright>
        <lastBuildDate>Sun, 23 Aug 2026 17:21:42 +0000</lastBuildDate><atom:link href="https://iamxurulin.github.io/tags/%E7%94%9F%E6%B4%BB/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>零基础看懂机器学习：不用数学，只要生活经验</title>
        <link>https://iamxurulin.github.io/p/%E9%9B%B6%E5%9F%BA%E7%A1%80%E7%9C%8B%E6%87%82%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0%E4%B8%8D%E7%94%A8%E6%95%B0%E5%AD%A6%E5%8F%AA%E8%A6%81%E7%94%9F%E6%B4%BB%E7%BB%8F%E9%AA%8C/</link>
        <pubDate>Thu, 04 Jun 2026 21:56:12 +0000</pubDate>
        
        <guid>https://iamxurulin.github.io/p/%E9%9B%B6%E5%9F%BA%E7%A1%80%E7%9C%8B%E6%87%82%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0%E4%B8%8D%E7%94%A8%E6%95%B0%E5%AD%A6%E5%8F%AA%E8%A6%81%E7%94%9F%E6%B4%BB%E7%BB%8F%E9%AA%8C/</guid>
        <description>&lt;p&gt;小时候，爸爸是怎么教你认动物的？&lt;/p&gt;
&lt;p&gt;爸爸会指着笼子里的家伙告诉你，这是老虎，身上有条纹；&lt;/p&gt;
&lt;p&gt;然后又指着树上的说，那是猴子，尾巴老长。&lt;/p&gt;
&lt;p&gt;看多了以后，下次去动物园，就算看到没见过的品种，你也能猜个八九不离十。&lt;/p&gt;
&lt;p&gt;这就是机器学习的核心思想：&lt;/p&gt;
&lt;p&gt;爸爸给你看的动物是&lt;strong&gt;训练数据&lt;/strong&gt;，他说的名字是&lt;strong&gt;标签&lt;/strong&gt;，你脑子里长出来的判断能力就是&lt;strong&gt;模型&lt;/strong&gt;，你能认出新品那就是&lt;strong&gt;预测&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;所有的学习都得有人教吗？&lt;/p&gt;
&lt;p&gt;当然不是。&lt;/p&gt;
&lt;p&gt;比如你第一次搬新家，打开衣柜，衣服扔得乱七八糟，没人帮你整理。&lt;/p&gt;
&lt;p&gt;你会怎么办？&lt;/p&gt;
&lt;p&gt;你可能会自己琢磨：&lt;/p&gt;
&lt;p&gt;这几件都是厚外套，归一块儿；&lt;/p&gt;
&lt;p&gt;那几件是短袖T恤，放一起；&lt;/p&gt;
&lt;p&gt;这些全是运动裤，也堆一起。&lt;/p&gt;
&lt;p&gt;没人告诉你该怎么分，是你自己看着像的放一堆。&lt;/p&gt;
&lt;p&gt;这就引出了机器学习的两大类别：&lt;strong&gt;监督学习&lt;/strong&gt;和&lt;strong&gt;无监督学习&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;监督学习&lt;/strong&gt;就像爸爸带你逛动物园，有老师有答案，数据带着标签，机器知道对错。&lt;/p&gt;
&lt;p&gt;比如，判断快递包裹是不是易碎品，每个包裹事先都标好了，是易碎还是普通。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;无监督学习&lt;/strong&gt;就像你自己收拾衣柜，没老师没答案，数据没标签，机器自己找规律。&lt;/p&gt;
&lt;p&gt;比如，把看视频的人分成几拨，机器自己发现哪些人爱好相似。&lt;/p&gt;
&lt;p&gt;监督学习是有人教，有标准答案；&lt;/p&gt;
&lt;p&gt;无监督学习是自己悟，没有标准答案。&lt;/p&gt;
&lt;h2 id=&#34;监督学习能干啥&#34;&gt;监督学习能干啥
&lt;/h2&gt;&lt;h3 id=&#34;案例1快递站怎么知道哪个包裹要轻拿轻放&#34;&gt;案例1——快递站怎么知道哪个包裹要轻拿轻放
&lt;/h3&gt;&lt;p&gt;其实是工作人员先收集了几万个包裹，人工标注这个易碎，那个不易碎。&lt;/p&gt;
&lt;p&gt;机器从这些标好的包裹里学习。&lt;/p&gt;
&lt;p&gt;如果箱子上贴着&amp;quot;玻璃&amp;quot;&amp;ldquo;瓷器&amp;quot;这些字，或者包装上有向上箭头的标识，大概率就是易碎件；&lt;/p&gt;
&lt;p&gt;如果发货地是某个工艺品集中地，也要小心。&lt;/p&gt;
&lt;p&gt;学完后，新包裹一到，机器就能自己判断要不要贴&amp;quot;轻放&amp;quot;标签。&lt;/p&gt;
&lt;h3 id=&#34;案例2外卖预估送达时间&#34;&gt;案例2——外卖预估送达时间
&lt;/h3&gt;&lt;p&gt;你点了一份奶茶，距离3公里，中午高峰期，下雨天，骑手手上还有两单，你肯定想知道几点能送到？&lt;/p&gt;
&lt;p&gt;以前是靠站长凭经验估算，但经验也常有偏差。&lt;/p&gt;
&lt;p&gt;机器学习怎么做？它先看历史订单。&lt;/p&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;p&gt;上周一，同样3公里、雨天、午高峰，送了35分钟；&lt;/p&gt;
&lt;p&gt;上周三，2公里、晴天、平峰期，送了20分钟……&lt;/p&gt;
&lt;p&gt;学完几千单规律后，你刚下单，它就能预测：这次大概需要38分钟。&lt;/p&gt;
&lt;h2 id=&#34;无监督学习能干啥&#34;&gt;无监督学习能干啥
&lt;/h2&gt;&lt;h3 id=&#34;案例1视频平台用户分群&#34;&gt;案例1——视频平台用户分群
&lt;/h3&gt;&lt;p&gt;假设你是某短视频平台的运营，手里有800万用户的观看记录，点赞记录、停留时长、关注列表都有。&lt;/p&gt;
&lt;p&gt;问题是，这800万人怎么运营？&lt;/p&gt;
&lt;p&gt;你跑一遍无监督算法，机器自动发现，用户居然能分成这么几类：&lt;/p&gt;
&lt;p&gt;第一类，专看搞笑段子，每天刷两小时，属于纯娱乐型；&lt;/p&gt;
&lt;p&gt;第二类，只看知识科普和纪录片，属于学习型；&lt;/p&gt;
&lt;p&gt;第三类，天天看美食和做饭视频，应该是生活爱好者；&lt;/p&gt;
&lt;p&gt;第四类，刷的都是穿搭和美妆，大概率是时尚人群。&lt;/p&gt;
&lt;p&gt;机器自己就把人分好了，不需要你提前说分几类、按什么分。&lt;/p&gt;
&lt;p&gt;然后你就可以给不同人群推不同的内容。&lt;/p&gt;
&lt;h3 id=&#34;案例2音乐app自动建歌单&#34;&gt;案例2——音乐App自动建歌单
&lt;/h3&gt;&lt;p&gt;某音乐软件曲库里有上千万首歌，不可能靠编辑一首首归类。&lt;/p&gt;
&lt;p&gt;这时候用无监督学习，机器自动分析歌曲。&lt;/p&gt;
&lt;p&gt;这一批歌里都有强烈的鼓点和吉他，应该是摇滚；&lt;/p&gt;
&lt;p&gt;那一批都是钢琴和弦乐，节奏舒缓，应该是轻音乐；&lt;/p&gt;
&lt;p&gt;还有一批全是方言说唱，应该是嘻哈类。&lt;/p&gt;
&lt;p&gt;整个过程没人教它什么是摇滚、什么是轻音乐，都是它自己听出来的规律。&lt;/p&gt;
&lt;p&gt;这就是无监督学习的厉害之处，让机器自己从数据里挖模式。&lt;/p&gt;
&lt;h2 id=&#34;怎么做一个机器学习项目&#34;&gt;怎么做一个机器学习项目
&lt;/h2&gt;&lt;h3 id=&#34;数据收集&#34;&gt;数据收集
&lt;/h3&gt;&lt;p&gt;首先，没数据就没机器学习。&lt;/p&gt;
&lt;p&gt;而且，&lt;strong&gt;数据质量比数量更重要&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;假设你想训练一个识别狗的模型，结果你找的照片里，狗全是柯基，那训练出来的模型看到哈士奇就不认识了。&lt;/p&gt;
&lt;p&gt;所以数据得够多、够杂、够有代表性。&lt;/p&gt;
&lt;h3 id=&#34;数据预处理&#34;&gt;数据预处理
&lt;/h3&gt;&lt;p&gt;数据收回来就能直接用吗？&lt;/p&gt;
&lt;p&gt;不能。&lt;/p&gt;
&lt;p&gt;为啥？&lt;/p&gt;
&lt;p&gt;因为真实数据一般都是乱糟糟的。&lt;/p&gt;
&lt;p&gt;什么叫乱糟糟？&lt;/p&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;p&gt;外卖订单里有一条记录，配送距离写了0.01公里，这显然不对；&lt;/p&gt;
&lt;p&gt;有的重量单位是千克，有的是斤，得统一；&lt;/p&gt;
&lt;p&gt;有的订单没填楼层信息，这也不行。&lt;/p&gt;
&lt;p&gt;所以这一步要清洗数据，删掉明显瞎填的，处理缺信息的，要么删了，要么补上，把所有数据转成统一的标准。&lt;/p&gt;
&lt;h3 id=&#34;特征工程&#34;&gt;特征工程
&lt;/h3&gt;&lt;p&gt;预测外卖送达时间的时候，哪些信息有用？&lt;/p&gt;
&lt;p&gt;距离有用、天气有用、时段有用，但骑手的手机号有用吗？&lt;/p&gt;
&lt;p&gt;没用，订单编号也没啥用。&lt;/p&gt;
&lt;p&gt;所以咱们得挑出对预测有帮助的信息，扔掉那些没用的。&lt;/p&gt;
&lt;p&gt;这还不够，有时候还得造新特征。&lt;/p&gt;
&lt;p&gt;比如我们有店铺出餐速度和配送距离，能不能组合一下？&lt;/p&gt;
&lt;p&gt;比如&amp;quot;每公里所需时间&amp;quot;这个指标，可能比单独的两个数字更有用，因为它能反映这段路到底堵不堵。&lt;/p&gt;
&lt;h3 id=&#34;训练模型&#34;&gt;训练模型
&lt;/h3&gt;&lt;p&gt;这一步就是让机器开始学。&lt;/p&gt;
&lt;p&gt;你要选个合适的算法，比如线性回归、决策树、随机森林，然后把训练数据喂给它：这是1万单历史数据，你好好学学，看看距离、天气、时段跟配送时间到底啥关系。&lt;/p&gt;
&lt;p&gt;机器就开始疯狂计算，不断调整内部参数，试图找到最好的对应关系。&lt;/p&gt;
&lt;p&gt;这就像学生刷题，刷得越多，理解越深，考试时发挥越好。&lt;/p&gt;
&lt;h3 id=&#34;模型评估&#34;&gt;模型评估
&lt;/h3&gt;&lt;p&gt;模型练完了能直接上线吗？&lt;/p&gt;
&lt;p&gt;不能，得先考试。&lt;/p&gt;
&lt;p&gt;咱们得留一部分数据不给它看，专门用来测它，这叫&lt;strong&gt;测试集&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;如果考得不好怎么办？&lt;/p&gt;
&lt;p&gt;那就回头检查，是不是数据不够？&lt;/p&gt;
&lt;p&gt;是的话再去多收点数据。&lt;/p&gt;
&lt;p&gt;是不是特征没选好？&lt;/p&gt;
&lt;p&gt;是的话重新做特征工程。&lt;/p&gt;
&lt;p&gt;是不是算法不合适？&lt;/p&gt;
&lt;p&gt;是的话换一个试试。&lt;/p&gt;
&lt;p&gt;这就是个不断试错、不断优化的过程。&lt;/p&gt;
&lt;h3 id=&#34;模型部署&#34;&gt;模型部署
&lt;/h3&gt;&lt;p&gt;这一步就是把模型放到真实业务里去跑。&lt;/p&gt;
&lt;p&gt;比如把外卖预估模型接到点餐App里，用户一下单，系统就实时显示&amp;quot;预计38分钟送达&amp;rdquo;。&lt;/p&gt;
&lt;p&gt;但上线不是结束，而是新的开始。&lt;/p&gt;
&lt;p&gt;为什么这么说？&lt;/p&gt;
&lt;p&gt;因为路况在变，今天和去年同时段的路况不一样，如果一直用老模型，预测就不准了。所以要持续盯着模型表现，定期拿新订单数据重新训练，这叫&lt;strong&gt;模型更新&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id=&#34;什么是特征&#34;&gt;什么是特征？
&lt;/h2&gt;&lt;p&gt;简单说，特征就是描述一件事的各种属性，是模型的输入。&lt;/p&gt;
&lt;p&gt;预测外卖时间时，距离、天气、时段就是特征；&lt;/p&gt;
&lt;p&gt;判断快递时，包装文字、重量、发货地就是特征；&lt;/p&gt;
&lt;p&gt;人脸识别时，眼睛大小、鼻子高低、脸型轮廓就是特征。&lt;/p&gt;
&lt;h3 id=&#34;特征的类型&#34;&gt;特征的类型
&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;数值型&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;能用数字表示的，比如年龄25岁、价格35块、温度30度。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;类别型&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;离散的类别。&lt;/p&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;p&gt;性别，男、女；&lt;/p&gt;
&lt;p&gt;城市，北京、广州；&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;布尔型&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;是或否。&lt;/p&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;p&gt;是否雨天；&lt;/p&gt;
&lt;p&gt;是否VIP；&lt;/p&gt;
&lt;p&gt;是否有电梯；&lt;/p&gt;
&lt;p&gt;其实，布尔型可以看作特殊的类别型。&lt;/p&gt;
&lt;h2 id=&#34;什么是标签&#34;&gt;什么是标签？
&lt;/h2&gt;&lt;p&gt;标签就是咱们想预测的结果，是模型的输出。&lt;/p&gt;
&lt;p&gt;机器学习里：&lt;/p&gt;
&lt;p&gt;预测外卖时间，标签就是&amp;quot;38分钟&amp;quot;；&lt;/p&gt;
&lt;p&gt;判断快递，标签就是&amp;quot;易碎&amp;quot;或&amp;quot;普通&amp;quot;；&lt;/p&gt;
&lt;p&gt;诊断疾病，标签就是&amp;quot;健康&amp;quot;或&amp;quot;生病&amp;quot;；&lt;/p&gt;
&lt;p&gt;需要注意的是，&lt;strong&gt;标签只在监督学习里有&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id=&#34;什么是模型&#34;&gt;什么是模型？
&lt;/h2&gt;&lt;p&gt;其实它就是一个函数。&lt;/p&gt;
&lt;p&gt;啥函数？&lt;/p&gt;
&lt;p&gt;从特征到标签的映射函数，数学上写成 &lt;strong&gt;y = f(x)&lt;/strong&gt;。x是输入的特征，y是输出的标签，f就是模型这个映射关系。&lt;/p&gt;
&lt;p&gt;模型就像一个送了十年外卖的老骑手，机器学习就是让机器通过大量订单积累这种经验，然后用到新订单上。&lt;/p&gt;
&lt;p&gt;不同的算法就是不同的积累经验的方式。&lt;/p&gt;
&lt;h2 id=&#34;怎么评估模型&#34;&gt;怎么评估模型？
&lt;/h2&gt;&lt;p&gt;评估就是检验模型好不好，但用啥指标，得看任务类型。&lt;/p&gt;
&lt;h3 id=&#34;分类任务&#34;&gt;分类任务
&lt;/h3&gt;&lt;p&gt;比如判断快递是不是易碎，最常用的是&lt;strong&gt;准确率&lt;/strong&gt;，看预测对了多少。&lt;/p&gt;
&lt;p&gt;比如100个包裹，你猜对了95个，准确率就是95%。&lt;/p&gt;
&lt;p&gt;但有时候光看准确率不够。&lt;/p&gt;
&lt;p&gt;比如做疾病筛查，1000个人里只有1个真的有病，模型偷懒，全预测成健康，准确率还有99.9%，但那个真有病的人被漏了，这能行吗？&lt;/p&gt;
&lt;p&gt;所以还得看&lt;strong&gt;召回率&lt;/strong&gt;，真正有病的人里，你找出来了多少？&lt;/p&gt;
&lt;p&gt;这就是为啥需要多种指标一起看。&lt;/p&gt;
&lt;h3 id=&#34;回归任务&#34;&gt;回归任务
&lt;/h3&gt;&lt;p&gt;比如预测外卖时间，常用的是&lt;strong&gt;平均绝对误差（MAE）&lt;/strong&gt;，预测时间和真实时间平均差多少？&lt;/p&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;p&gt;预测时间平均误差3分钟，说明还挺靠谱；&lt;/p&gt;
&lt;p&gt;如果平均误差20分钟，那就差太远了。&lt;/p&gt;
&lt;p&gt;还有，&lt;strong&gt;R²系数&lt;/strong&gt;取值通常在0到1之间，越接近1说明模型越好。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
