An Introduction to Statistical Learning
以较低数学门槛系统讲解回归、分类、重采样、树模型、正则化与无监督学习。
James / Witten / Hastie / Tibshirani / Taylor · StatLearning
外部资料索引
只保存简短介绍、关联概念和外部链接,不复制外部文章或课程内容。
以较低数学门槛系统讲解回归、分类、重采样、树模型、正则化与无监督学习。
James / Witten / Hastie / Tibshirani / Taylor · StatLearning
以统一框架组织搜索、知识、推理、规划、学习、智能体和机器人等主题。
Stuart Russell / Peter Norvig · AIMA
提出完全基于注意力机制的 Transformer 架构,并用于序列建模和机器翻译。
Vaswani et al. · arXiv / NeurIPS
在 Bellman 误差之外加入保守价值正则,降低固定数据外动作的乐观估计。
Kumar et al. · arXiv / NeurIPS
通过搜索、知识表示、概率、优化、机器学习与语言项目学习 AI 基础。
Brian Yu / David J. Malan · Harvard CS50
沿 MDP、动态规划、价值函数、TD、策略梯度和函数近似讲解经典强化学习。
David Silver · Google DeepMind / YouTube
系统讲解线性代数、优化、前馈网络、正则化、卷积、序列模型与研究主题。
Goodfellow / Bengio / Courville · DeepLearningBook.org
介绍 DeepSeekMath 训练流程及以组内相对奖励替代独立 Value Model 的 GRPO。
Shao et al. · arXiv
把带参考策略约束的偏好优化转写为直接训练 chosen/rejected 概率差的目标。
Rafailov et al. · arXiv / NeurIPS
把数学、图示、文字与可执行代码结合,系统覆盖深度学习基础和现代模型。
Zhang / Lipton / Li / Smola · D2L.ai
以短视频、可视化和练习讲解回归、分类、数据、过拟合与神经网络基础。
Google · Google for Developers
从 Q-Learning、DQN、Policy Gradient 和 Actor-Critic 逐步进入 PPO 与多智能体。
Hugging Face · Hugging Face
从客户端、服务器、工具、资源和提示等对象解释 MCP 的连接模型。
Model Context Protocol · MCP
MCP 官方参考服务器与 SDK 使用示例,适合学习工具和资源暴露方式。
MCP Steering Group · GitHub
展示 MCP 服务器能力和协议用法
主要语言:TypeScript / Python不包含数据集或实验需要额外环境通过 expectile value、数据动作 TD 更新和优势加权行为克隆完成隐式策略改进。
Kostrikov / Nair / Levine · arXiv
系统介绍 Agent、工具、Handoff、Guardrail、Session 与追踪等核心组件。
OpenAI · OpenAI
说明模型如何调用函数、搜索、计算机操作及其他工具,并展示结构化参数。
OpenAI · OpenAI Platform
OpenAI Agents SDK 的 Python 源码、文档、示例与集成测试仓库。
OpenAI · GitHub
构建和研究多 Agent 工作流
主要语言:Python包含数据集或实验需要额外环境提出使用深度网络、经验回放和目标网络从像素输入学习 Atari 控制策略。
Mnih et al. · arXiv
以项目驱动方式学习视觉、NLP、表格模型、协同过滤和模型部署。
Jeremy Howard · fast.ai
提出基于概率比率裁剪的策略优化目标,限制单次更新幅度并复用 rollout。
Schulman et al. · arXiv
从张量、数据加载、自动微分和网络训练逐步进入视觉、NLP、性能与部署。
PyTorch Contributors · PyTorch
提供视觉、文本、强化学习和分布式训练等 PyTorch 参考示例。
PyTorch · GitHub
运行和研究常见 PyTorch 模型示例
主要语言:Python包含数据集或实验需要额外环境从多臂赌博机、MDP、动态规划、蒙特卡洛和 TD 方法建立强化学习理论主线。
Richard Sutton / Andrew Barto · MIT Press
按算法和应用组织可运行示例,展示预处理、训练、评估与可视化流程。
scikit-learn Contributors · scikit-learn
覆盖监督学习、无监督学习、预处理、模型选择、评估和常见陷阱。
scikit-learn Contributors · scikit-learn
从术语、数学背景和算法分类进入 VPG、TRPO、PPO、DDPG、TD3 与 SAC。
OpenAI · OpenAI
为离线强化学习提供标准化数据集 API、数据集目录和数据收集工具。
Farama Foundation · GitHub
加载、创建和管理离线 RL 数据集
主要语言:Python包含数据集或实验需要额外环境通过优化输入和可视化神经元响应解释深度网络内部学到的特征。
Olah / Mordvintsev / Schubert · Distill
以密集讲座和实验介绍神经网络、序列模型、生成模型和深度学习应用。
MIT 6.S191 Team · MIT
从指标、特征、管线和迭代方式总结构建真实机器学习系统的实践原则。
Martin Zinkevich · Google for Developers
经典机器学习算法、模型选择、预处理和评估工具的核心实现仓库。
scikit-learn Contributors · GitHub
研究 scikit-learn 实现和贡献流程
主要语言:Python / Cython包含数据集或实验需要额外环境用图形和分步推理讲解回归、分类、树模型、聚类、PCA 与评估指标。
Josh Starmer · YouTube
在浏览器中调整特征、隐藏层、激活函数和学习率,观察分类边界变化。
TensorFlow Team · TensorFlow
覆盖智能体、搜索、博弈、概率推理、MDP、强化学习和机器学习。
UC Berkeley EECS · UC Berkeley
提供分类、回归、聚类等任务常用的公开数据集和字段说明。
UC Irvine · UCI
以单文件实现和实验报告呈现 DQN、PPO、SAC 等深度强化学习算法。
CleanRL Contributors · GitHub
阅读可复现的单文件 RL 算法实现
主要语言:Python包含数据集或实验需要额外环境