【数值计算】牛顿迭代法(Newton's method,Newton-Raphson method,牛顿-拉夫逊(拉弗森))计算二次方根(sqrt)三次方根
[LLM+RL] 理解 GRPO 公式原理及 TRL GrpoTrainer 代码实现(advantage 与 loss 计算)
【回归】多元线性回归分析(最小二乘法,矩阵矢量形式,解析解)
[A100 Training] 04 verl/slime Docker 容器 debug,断点调试,源码细读,ray 分布式 debug
[LLMs 实践] 01 llama、alpaca、vicuna 整体介绍及 llama 推理过程
[LLM + RL] kimi 1.5 论文导读与 highlights
[实用 AI] GPT/Gemini 全流程参与 idea 生成,实验设计,Paper writing | AI scientist | NotebookLM
[硬件扫盲] 苹果 M5 pro/max 芯片,对比 Nvidia GPU,内存带宽,统一内存,tensor core,融合架构
[M芯片与AI计算] 02 Coding Agent 时代的 MacOS 装机配置与心流体验的获得,实用 CLI 工具,rg、yazi、fzf、uv
[Agentic Infra] 03 算力密度与Roofline model,对比 5090/M5 max/DGX spark,Qwen3-8B 算力与访存
[LLM+RL] R1 论文导读,SFT vs. RL,RL 基础以及 GRPO 细节,以及一系列复现工作讨论
[Agent Works] Gemini 2.5 Pro + Agent = IMO 金牌,actor-critic,生成 -> 验证 -> 修正 迭代循环
[数学基础与PyTorch] 03 回顾策略梯度,score function trick,蒙特卡洛采样,pytorch 优化与重要性采样
[数学基础与PyTorch] 07 MHA 的 QKVO 四重投影,为什么少不了 W_O?concat 再乘 ≡ 逐 head 求和 | OV 电路 rank
[Agentic Infra] 02 RL post-training 训练框架,训练流程参数分析与指标监控,显存分配与性能调优
[pytorch 强化学习] 01 认识环境(environment,gym.Env)以及 CartPole-v0/v1 环境
[数学基础与PyTorch] 06 理解高维Tensor,手撕 MHA 为什么先 reshape 再 permute?view/stride/contiguou
[智能的边界] 深入 GPT Pro,通用工具设计(搜索与cli),沙盒系统硬件,skills,Python环境,UV,下载限制与 tex pdf 等
[Modern Agent] 18 何时如何保持思维链 CoT,interleaved thinking,kvcache 利用,Qwen3.6
[LLM Architect] 12 Kimi K3 架构初步,张量计算视角,KDA,MLA,Latent MoE,MoonViT 与残差注意力