
文章目录一、机器学习四大学习范式二、从人工智能到大模型的演变脉络三、机器学习算法与任务分类3.1 监督学习带标签数据3.1.1 分类任务输出离散类别3.1.2 回归任务输出连续数值3.2 无监督学习无标签数据3.2.1 聚类任务样本自动分组3.2.2 关联规则挖掘发现共现模式3.2.3 降维高维数据压缩3.3 自监督学习自动构造监督信号3.4 强化学习交互反馈式学习3.5 深度学习深度神经网络四、机器学习完整建模流程4.1 数据预处理清洗脏数据4.2 特征工程建模核心步骤4.3 数据集划分4.4 模型训练4.5 模型评估与优化五、拓展对比与核心要点5.1 传统机器学习 vs 深度学习5.2 过拟合与欠拟合建模最常见挑战5.3 大模型时代的关键概念速览一、机器学习四大学习范式按训练信号来源划分机器学习可分为四大主流范式学习范式通俗注解核心定义典型任务与算法应用场景监督学习人类给标准答案训练数据包含「输入特征 人工标注标签」模型学习输入到输出的映射关系分类、回归逻辑回归、SVM、决策树、随机森林图像分类、房价预测、垃圾邮件识别无监督学习无标准答案自主挖掘规律数据无人工标签模型挖掘数据内在分布与相似关系聚类、降维、关联规则K-Means、PCA、Apriori用户分群、购物篮分析、数据可视化自监督学习自己构造答案基于无标注数据内部信息自动构造预测目标是当前预训练的主流方案掩码预测、对比学习BERT、ViT、SimCLR大模型预训练、通用视觉/语言特征提取强化学习环境奖惩反馈智能体与环境交互依靠奖励/惩罚信号优化行为策略最大化长期累积收益策略梯度、DQN、PPO、RLHF游戏 AI、机器人控制、大模型对齐辨析要点自监督学习与无监督学习都不需要人工标注区别在于——自监督会主动构造伪标签作为预测目标如遮住一个词让模型猜本质上仍是一种有目标的学习无监督学习则完全不设预测目标只关注发现数据结构。二、从人工智能到大模型的演变脉络四层从属关系由外到内逐层聚焦层级名称定位关键特征第 1 层人工智能AI总目标让机器模拟人类感知、推理、决策能力涵盖规则系统、搜索、知识图谱等第 2 层机器学习MLAI 核心分支不靠硬编码规则通过数据自动学习规律第 3 层深度学习DLML 子集多层深度神经网络自动提取从底层到高层的特征第 4 层大模型LLM/多模态DL 前沿应用基于自监督预训练的超大参数模型具备通用理解与生成能力数学表达AI ⊃ ML ⊃ DL ⊃ LLM \text{AI} \supset \text{ML} \supset \text{DL} \supset \text{LLM}AI⊃ML⊃DL⊃LLM三、机器学习算法与任务分类3.1 监督学习带标签数据3.1.1 分类任务输出离散类别目标判断样本归属哪一类二分类/多分类典型算法逻辑回归、SVM、决策树、随机森林、CNN案例猫狗识别、疾病诊断、垃圾短信检测3.1.2 回归任务输出连续数值目标预测连续实数值典型算法线性回归、多项式回归、梯度提升树XGBoost、LightGBM案例房价预测、销量预估、气温预测3.2 无监督学习无标签数据3.2.1 聚类任务样本自动分组目标按样本相似度自动划分群组典型算法K-Means、DBSCAN、层次聚类案例电商客户分层、文本主题聚类、异常检测3.2.2 关联规则挖掘发现共现模式目标挖掘数据中频繁同时出现的组合关系典型算法Apriori、FP-Growth案例超市购物推荐经典啤酒与尿布、商品搭配分析3.2.3 降维高维数据压缩典型算法PCA、t-SNE、UMAP作用高维数据压缩与可视化、减少计算量、缓解维度灾难3.3 自监督学习自动构造监督信号核心思想从未标注数据中设计pretext task代理任务让模型自己生成学习信号主流范式掩码语言模型MLM随机遮住文本中的词让模型预测——代表BERT掩码图像建模MIM遮住图像 patch 让模型重建——代表MAE对比学习拉近同一样本不同增强视角推远不同样本——代表SimCLR、MoCo意义大模型时代预训练的基石解决了人工标注成本过高的瓶颈3.4 强化学习交互反馈式学习核心要素智能体Agent、环境Environment、状态State、动作Action、奖励Reward主流算法DQN、PPO、A3C、SAC现代应用RLHF人类反馈强化学习用于大模型价值观对齐、AlphaGo、机器人运动控制、自动驾驶决策3.5 深度学习深度神经网络核心特点多层神经网络自动提取底层→高层特征无需人工特征工程主流网络架构架构擅长领域代表模型CNN卷积神经网络图像、视频ResNet、EfficientNetRNN / LSTM / GRU时序、语音Seq2SeqTransformer文本、多模态当前主流BERT、GPT、ViT、LLaMAGAN / Diffusion图像生成StyleGAN、Stable Diffusion四、机器学习完整建模流程完整链路业务定义与数据采集 → 数据预处理 → 特征工程 → 数据集划分 → 模型训练 → 模型评估调优 → 部署上线与持续迭代4.1 数据预处理清洗脏数据解决原始数据缺陷保证训练有效性步骤操作说明缺失值处理填充均值/中位数/众数或删除高缺失字段缺失比例 70% 的字段通常直接丢弃异常值处理箱线图IQR、3σ 原则区分真实极端值与录入错误去重删除完全重复样本避免权重偏移标准化/归一化Z-score 标准化、Min-Max 归一化消除量纲影响加速梯度下降收敛类别编码One-Hot 编码、标签编码、Target 编码将文本类别转为模型可计算的数值4.2 特征工程建模核心步骤将原始数据转化为有效预测特征特征构造组合衍生新特征如日均消费 总消费 / 天数交互特征 特征A × 特征B特征选择剔除无关、冗余特征降低维度方差过滤、互信息、L1 正则化特征变换对数变换处理偏态、离散分箱、文本向量化TF-IDF、Word2Vec经验法则传统机器学习中“数据和特征决定了模型上限算法只是在逼近这个上限”。深度学习通过端到端学习弱化了人工特征工程但在结构化数据表格数据场景中精细的特征工程仍然关键。4.3 数据集划分标准三划分通用比例 7:1:2 或 8:1:1数据集比例用途注意事项训练集70%~80%模型学习参数—验证集10%~15%调超参数、早停判断、模型筛选可反复使用测试集10%~20%最终真实性能评估只能在最终评估时使用一次铁律测试集禁止参与训练或调参否则评估结果虚高模型上线后性能将大幅退化数据泄露。4.4 模型训练根据任务类型选择对应算法分类/回归/聚类/生成设置超参数学习率、树深度、网络层数、Batch Size 等迭代优化最小化损失函数通过反向传播持续更新模型参数早停策略Early Stopping验证集性能连续 N 轮不再提升时停止防止过拟合学习率调度Warmup Cosine Decay 等策略提升训练稳定性4.5 模型评估与优化分类任务核心指标指标含义适用场景准确率Accuracy预测正确的比例类别均衡时参考精确率Precision预测为正中真正为正的比例关注误报代价时如垃圾邮件召回率Recall实际为正中被正确识别的比例关注漏报代价时如疾病筛查F1-Score精确率与召回率的调和平均综合衡量类别不均衡时优先看AUC-ROC模型区分正负样本的整体能力阈值无关的综合评估回归任务核心指标指标含义MSE均方误差对大误差惩罚更重MAE平均绝对误差对异常值更鲁棒R²决定系数模型解释方差的比例越接近 1 越好常用优化手段网格搜索/随机搜索/贝叶斯优化调参、K 折交叉验证、正则化L1/L2/Dropout、集成学习Bagging/Boosting/Stacking、数据增强。五、拓展对比与核心要点5.1 传统机器学习 vs 深度学习对比维度传统机器学习深度学习代表算法线性回归、SVM、决策树、XGBoostCNN、Transformer、Diffusion特征工程高度依赖人工设计端到端自动学习特征数据需求小数据集千~万级即可工作通常需要海量数据百万级以上算力需求CPU 即可依赖 GPU/TPU 集群可解释性较强可看特征权重、树结构较弱黑箱需 SHAP/LIME 等辅助适用场景结构化表格数据、中小规模问题图像、文本、语音、多模态等复杂任务5.2 过拟合与欠拟合建模最常见挑战问题表现常见原因应对策略过拟合训练集表现好验证/测试集差模型过于复杂、数据量不足、训练过久正则化、Dropout、早停、数据增强、增加数据欠拟合训练集和测试集表现都差模型太简单、特征不足、学习率不当增加模型复杂度、增加特征、延长训练5.3 大模型时代的关键概念速览概念一句话解释预训练Pre-training在海量无标注数据上用自监督任务学习通用表示微调Fine-tuning在特定任务小数据集上继续训练适配下游任务RLHF用人类偏好反馈训练奖励模型再通过强化学习对齐模型输出Prompt Engineering通过设计输入提示词引导模型输出无需修改参数RAG检索增强生成先从知识库检索相关文档再交给模型生成回答多模态模型同时理解文本、图像、音频、视频等多种信息形式