机器学习
机器学习 — 按照清晰的学习路径,从基础原理走向实际应用。
Find a reading order in the learning guides → Search this field →
所有领域
基准测试本地LLM:首次响应、生成率和内存
将首次答案内容与生成率和控制分开衡量 residency, caching and memory conditions.
Hands-on · 3 分钟阅读
机器学习
September 5, 2026
目标检测与语义分割入门——从图像中读取“物体位置”
目标检测通过绘制方框来框选物体;语义分割则根据图像含义为每个像素着色。本文将从两者的区别入手,探讨实例分割和全景分割,追溯 R-CNN、YOLO、DETR 和 DINO 的发展历程,直至它们对应的 3D 点云模型——系统地介绍场景理解的基本原理。
Fundamentals · 19 分钟阅读机器学习入门:生成模型
生成模型表示数据分布并生成条件输出。学习似然性、变分自编码器(VAE)、生成对抗网络(GAN)、扩散、评估、溯源和安全性。
Fundamentals · 6 分钟阅读 机器学习 September 4, 2026机器学习入门:基础篇——数据设计、损失函数和泛化
“机器学习不仅仅是模型选择:它还包括定义任务、数据划分、损失函数、评估和部署变更。”
Fundamentals · 6 分钟阅读 机器学习 September 4, 2026SegFormer详解——为什么没有位置编码的Transformer也能用于视频分割
本文基于原始论文,对NVIDIA、香港大学及其合作者在NeurIPS 2021上提出的SegFormer进行了深入剖析。我们考察了不带位置编码的分层MiT编码器、参数高效的All-MLP解码器、有效感受野、测量得到的mIoU、参数数量,并使用公式计算了从B0到B5的性能。
Fundamentals · 13 分钟阅读 机器学习 September 4, 2026YOLO11 深度解析——C3k2 和 C2PSA 与 YOLOv8 相比发生了哪些变化?
“使用官方文档和原始资料(C3k2、C2PSA、无锚点检测、DFL/CIoU 损失以及 n/s/m/l/x 的测量基准)来分解 Ultralytics YOLO11。”
Fundamentals · 15 分钟阅读 机器学习 September 4, 2026机器学习入门:神经网络基础
神经网络堆叠仿射变换和非线性激活,然后通过反向传播和基于梯度的优化来减少损失。
Fundamentals · 6 分钟阅读 机器学习 September 4, 2026机器学习入门:姿态估计
姿态估计从图像中推断人或物体的关键点和六维姿态。本入门指南涵盖坐标、损失函数、遮挡、评估和安全性等方面的内容。
Fundamentals · 5 分钟阅读多智能体强化学习入门——如何在对方也在学习的世界中进行优化
当多个智能体同时学习时,单智能体马尔可夫决策过程(MDP)不再适用。本文通过公式和图表,系统地阐述了非平稳性、合作/竞争/混合环境、CTDE、信用分配问题以及MADDPG和QMIX等问题。
Fundamentals · 12 分钟阅读 强化学习 September 4, 2026π0详解——流量匹配如何改变VLA动作生成
“物理智能π0的基于源代码的技术指南:PaliGemma VLM和专用动作专家,具有条件流匹配的连续动作生成,跨越七种机器人类型的跨具身训练,以及与RT-2和OpenVLA等自回归VLA模型的区别。”
Fundamentals · 13 分钟阅读奖励设计入门——为什么“最大化什么”是强化学习中最难的部分
在强化学习的实现中,奖励函数的设计往往比算法本身更能决定最终结果。本文将探讨稀疏奖励与密集奖励、基于势函数的奖励塑造的策略不变性、奖励操纵的真实案例、逆强化学习以及约束强化学习。
Fundamentals · 11 分钟阅读强化学习入门:模仿学习和逆强化学习
行为克隆、DAgger 和逆强化学习在奖励难以编写时会使用演示。本入门指南涵盖协变量偏移、奖励推断、VLA 连接、评估、安全性和数据来源。
Fundamentals · 7 分钟阅读 强化学习 September 3, 2026强化学习基础——马尔可夫决策过程、贝尔曼方程和机器人探索
强化学习是一个闭环过程,其中智能体根据观察结果选择动作并最大化延迟奖励。本入门教程解释了马尔可夫决策过程(MDP)、价值函数、策略、贝尔曼方程、探索与利用、奖励设计以及从仿真到真实机器人的实现路径。
Fundamentals · 8 分钟阅读 强化学习 September 3, 2026基于模型的强化学习和模拟到现实
世界模型、预测误差、模型预测控制、域随机化、系统辨识以及真实机器的安全监控。
Fundamentals · 6 分钟阅读策略梯度、PPO 和 SAC——机器人稳定连续控制
策略梯度直接更新策略,从而保持转向、推力和关节扭矩的连续性。本文将Actor-Critic算法、PPO算法和SAC算法联系起来,然后讨论裁剪、熵正则化、评估以及仿真到实测迁移的安全边界。
Fundamentals · 8 分钟阅读Q学习和DQN——从Q表到深度强化学习
Q学习使用贝尔曼最优目标来更新动作值。本入门教程从表格形式的Q表讲解到深度Q网络,解释了经验回放、目标网络、高估以及机器人堆叠中的安全放置等概念。
Fundamentals · 8 分钟阅读