欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Google机器学习速成课程全面升级:从线性回归到大语言模型的实践指南

1970/1/1人工智能

新版Google机器学习速成课程覆盖从传统模型到LLM与AutoML,强调交互式学习,全球数百万学习者已受益。

前言:MLCC的进化与影响

自2018年首次发布以来,Google的Machine Learning Crash Course(MLCC)已成为全球最受欢迎的机器学习入门资源之一。据官方统计,已有数百万世界各地的学习者通过这一课程掌握了机器学习的基本原理,并将其应用于实际工作与研究中。

如今,随着人工智能领域在生成式AI、大语言模型(LLM)等方面的爆炸性进展,MLCC也迎来了自诞生以来的首次重大版本更新。新版课程不仅保留了原有的核心教学内容,还增加了一系列针对近年来AI技术发展的新模块,并大幅强化了交互式学习体验——通过内置的可视化工具、代码实验室和即时反馈机制,学习者可以更直观地理解复杂概念。

课程模块深度解析

新版MLCC共包含12个核心模块,从基础回归模型一路延伸到生产级ML系统与AI伦理。以下逐一拆解每个模块的关键技术点,并补充必要的背景知识。

1. 线性回归(Linear Regression)

这是机器学习入门的基石模块。课程从最简单的线性模型入手:

  • 模型形式:( y = w\cdot x + b ),其中( w )为权重,( b )为偏置。
  • 损失函数:重点讲解均方误差(MSE),即( \frac{1}{N}\sum_{i=1}^{N}(y_i - \hat{y}_i)^2 ),它是回归任务最常用的损失度量。
  • 梯度下降:详细推导了参数更新法则( w := w - \alpha \cdot \frac{\partial L}{\partial w} ),并强调**学习率(( \alpha ))**的重要性——学习率过大导致震荡,过小则收敛缓慢。
  • 超参数调优:讨论了验证集的作用,以及如何通过网格搜索或随机搜索寻找最佳超参数组合。

数据补充:模块中附有交互式可视化,允许学习者拖动点、实时观察回归线的变化,直观体会权重更新过程。

2. 逻辑回归(Logistic Regression)

尽管名字带“回归”,逻辑回归实为分类问题的基石。本模块核心内容包括:

  • Sigmoid函数:将线性输出压缩至(0,1)区间,解释为概率( P(y=1|x) )。
  • 对数损失(Log Loss):即交叉熵损失,公式为( -[y\log(p) + (1-y)\log(1-p)] ),对惩罚错误置信度有良好性质。
  • 决策边界:说明如何通过设置阈值(通常为0.5)将概率转化为离散类别。

补充背景:逻辑回归广泛用于信用评分、医疗诊断等领域,其可解释性远超复杂模型,至今仍是工业界强基线。

3. 分类(Classification)

本模块深入二元分类模型的评估细节:

  • 阈值(Threshold):默认0.5,但可调整以权衡误报与漏报。
  • 混淆矩阵(Confusion Matrix):TP/FP/TN/FN四个格子,是几乎所有分类指标的基础。
  • 核心指标:
    • 准确率(Accuracy):总体正确率,但在类别不平衡时具有误导性(例如99%负样本的全副样本分类器也有99%准确率)。
    • 精确率(Precision):( \frac{TP}{TP+FP} ),衡量“预测为正的样本中有多少是真正的正类”。
    • 召回率(Recall):( \frac{TP}{TP+FN} ),衡量“真正的正类中有多少被找出来”。
    • AUC(ROC曲线下面积):综合反映了分类器在不同阈值下的表现,AUC越大,排序能力越强。

实用技巧:往往精确率与召回率不可兼得(例如癌症筛查更重召回,垃圾邮件过滤更重精确),课程提供了F1分数等调和平均指标来平衡两者。

4. 处理数值数据(Working with Numerical Data)

现实世界的数据很少是干净均匀分布的。本模块教授:

  • 数据清洗:处理缺失值(均值填充、插值或删除)、异常值(Z-score或IQR方法)等。
  • 特征缩放:两种主流方法——标准化(Standardization,减去均值除以标准差)和归一化(Normalization,缩放到0~1区间)。缩放对于基于距离的模型(如KNN)和梯度下降收敛速度影响显著。
  • 分箱(Binning):将连续变量离散化,赋予模型非线性表达能力,但需防过拟合。
  • 对数变换与幂变换:处理右偏长尾分布,使数据更接近高斯分布。

5. 处理类别数据(Working with Categorical Data)

类别数据(如颜色、城市、职业)无法直接输入数值模型,本模块介绍了四种关键编码技术:

  • 区分类别与数值数据:数值有大小意义,类别没有(如邮编虽然数字但实际是类别)。
  • One-hot编码:为每个类别创建一个二进制列(如“红色”[1,0,0],“绿色”[0,1,0])。优点是无序假设,缺点是高基数特征会爆炸维度。
  • 特征哈希(Feature Hashing):将类别文本通过哈希函数映射到固定长度的索引,节省内存,但可能有碰撞。常用于大规模广告推荐系统。
  • 均值编码(Mean Encoding):用目标变量的均值来编码类别,如该城市中用户点击率的均值。能力强大但易过拟合,需配合交叉验证。
  • 特征交叉(Feature Crosses):将多个特征的组合作为新特征,例如将"年龄"和"性别"交叉成多个布尔特征,以使线性模型能学习非线性关系。

6. 数据集、泛化与过拟合(Datasets, Generalization, and Overfitting)

这是模型能否落地的关键模块,重点如下:

  • 数据划分:训练/验证/测试三集分离,测试集只能在最终评估时使用一次。
  • 泛化陷阱:训练集表现很好但测试集差,即过拟合。原因包括模型过于复杂、特征维度过高、训练数据过少等。
  • 应对过拟合:正则化(L1、L2)、早停法(Early Stopping)、Dropout(神经网络中)以及增加训练数据。
  • 数据泄漏(Data Leakage):如果验证或测试样本的信息间接进入训练(例如归一化系数全数据集计算),导致评估结果虚高,这是严重错误。

7. 神经网络(Neural Networks)

  • 感知机(Perceptron):单层线性分类器,是RNN/CNN等的始祖。
  • 隐藏层(Hidden Layers):层数越多,网络表达能力越强,但训练难度和计算成本也随之上升。理论上可以逼近任意函数,但需要足够的数据和避免梯度消失。
  • 激活函数:常用有ReLU(( f(x)=\max(0,x) ))、Sigmoid、Tanh。ReLU计算简单且缓解梯度消失,成为现代网络默认激活。
  • 反向传播:通过链式法则计算损失对每个权重的梯度,进而更新权重。

补充知识:深层网络需要大量数据和算力,这促进了GPU并行计算和随机梯度下降(SGD)的实用化。

8. 嵌入(Embeddings)

处理极高维特征(例如稀疏的词汇ID向量)时,传统方法效率低下。嵌入(Embedding)将稀疏向量映射到低维稠密向量,且保留语义相似性。

  • 原理:通过一个可学习的权重矩阵(形状为Vocabulary_size × Embedding_dim),将one-hot编码的输入点乘后获得连续向量。
  • 用途:不仅用于NLP(词嵌入),也用于推荐系统(用户/物品ID的嵌入)。
  • 好处:极大减少参数数量,泛化能力更强,例如"猫"和"狗"的嵌入向量距离相近。

9. 大型语言模型入门(New Intro to Large Language Models)

这是新课程中的一个全新模块,反映了AI领域的最前沿。内容覆盖:

  • Token:如何将文本切分为子字或词级别的token(如"unbelievable"被拆成"un", "believ", "able")。词汇表通常有数十万级别。
  • Transformer架构:基于自注意力机制,允许每个token与序列中其他token直接交互,解决了RNN并行性差和长期依赖问题。
  • 预测文本输出:LLM的核心是语言建模任务——给定前文预测下一个token的概率分布,通过极大似然训练。
  • 预训练与微调:首先在海量无标签文本上预训练获得语言知识,再通过有监督微调(SFT)和人类反馈强化学习(RLHF)对齐到有用和安全。
  • 涌现能力:模型参数量达到百亿级别后,自动获得上下文学习、推理等能力,无需显式训练。

10. 生产级ML系统(Production ML Systems)

模型研究关注准确率,但生产环境需要考虑从数据收集到部署监控的全链路:

  • 数据管道:实时与批量处理,特征存储与验证。
  • 模型部署:在线服务器推理或边缘设备推理(TensorFlow Lite)。
  • 模型监控:线上反馈漂移检测(例如输入分布随时间变化)、模型性能指标收集与告警。
  • A/B测试:验证新模型是否真正提升业务指标。
  • 工作流管理:使用Kubeflow或TensorFlow Extended(TFX)编排各个组件。

11. AutoML(自动化机器学习)

AutoML是新的热门领域,本模块教如何利用自动化的方法简化模型开发:

  • 神经架构搜索(NAS):算法自动搜索最佳网络结构,如NASNet、EfficientNet。
  • 自动特征工程与超参数调优:例如Google Cloud的Vertex AI Pipelines,可自动尝试多种特征变换和模型参数组合。
  • 原则与最佳实践:区分哪些环节可以自动化(超参搜索、模型选择),哪些需要人类判断(业务定义、约束条件);以及AutoML的适用场景和局限性(需要足够数据量)。

12. ML公平性(ML Fairness)

机器学习模型可能固化甚至放大社会偏见,本书强调:

  • 识别偏见:数据集偏差(如招聘历史数据中男性占多数)、标注偏差、评估偏差。
  • 公平性指标:例如不同群体间精确率/召回率差异,或者假阳性率平等(Equalized Odds)。
  • 缓解策略:预处理(重新加权、平衡采样),处理中调整目标,后处理调整阈值。
  • 审计实践:持续评估模型在不同人口群体上的表现,并建立反馈闭环。

总结与互动学习价值

新版MLCC最显著的特点是从被动观看转为主动交互。每个模块内嵌有可视化编辑器、即时运行的代码片段和Playground实验(如TensorFlow Playground生成分类可视化),帮助学习者在动手中理解参数变化对结果的影响。这对于抽象概念(如损失曲面、梯度更新)的理解尤为有帮助。

对于希望系统入门机器学习的读者,无论你是软件工程师、数据科学家还是学生,MLCC都值得精读。课程是免费的,并且提供多种语言版本(包括简体中文)。建议按照模块顺序学习,平均每模块估计需要1-2小时,搭配官方编程练习(在Kaggle或Colab上)效果最佳。

自从2018年首次推出以来,MLCC已经帮助了数百万人。新版更将拥抱生成式AI潮流,填补了传统课程与大模型时代的裂痕。立即开始学习吧,机器学习不是魔法,而是可以解构的科学。


原文链接:https://developers.google.com/machine-learning/crash-course/

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消