【矩阵分析】从特征值特征向量到矩阵SVD奇异值分解(np.linalg.svd)
[LLM+RL] 理解 GRPO 公式原理及 TRL GrpoTrainer 代码实现(advantage 与 loss 计算)
【数值计算】牛顿迭代法(Newton's method,Newton-Raphson method,牛顿-拉夫逊(拉弗森))计算二次方根(sqrt)三次方根
[Modern Agent] 17 Codex 中的 Plan Mode 与 update_plan,plan dynamics:创建、状态更新与replan
【回归】多元线性回归分析(最小二乘法,矩阵矢量形式,解析解)
[LLM Architect] 10 为什么LLM无法理解输出马嘉祺,深入理解Glitch(故障)Token,词嵌入漂移、SFT/RL、gradient 视角
[LLM Architect] 09 深入理解和对比 prefill与decode | kv-cache | 并行-串行 | GEMM-GEMV | 算力-带宽
[M芯片与AI计算] 01 硬件视角下的 M5 内存带宽概念与计算,mactop,实际代码测试(MPS、Stream),魔改48GB版本4090
[探索智能的边界] 喜迎 GPT Image 2,多图一致性,agentic search,thinking and generating
[数学基础与PyTorch] 02 梯度的视角回顾 Pretrain 和 SFT 的 Cross Entropy Loss,LLM如何更新 token emb
[Modern Agent] 14 Codex 中的上下文压缩 compact 与 handoff | openai compact 接口提示词破解
[Agentic Infra] 02 RL post-training 训练框架,训练流程参数分析与指标监控,显存分配与性能调优
[pytorch 强化学习] 01 认识环境(environment,gym.Env)以及 CartPole-v0/v1 环境
[A100 Training] 01 熟悉一台A100 SXM GPU计算节点,必要基础配置,SXM/PCIe/HGX,CPU与GPU带宽及内存带宽测试
【会计】个人所得税速算扣除数的计算及推导
[LLM+RL] R1 论文导读,SFT vs. RL,RL 基础以及 GRPO 细节,以及一系列复现工作讨论
[LLMs 实践] 01 llama、alpaca、vicuna 整体介绍及 llama 推理过程
[实用 AI] GPT/Gemini 全流程参与 idea 生成,实验设计,Paper writing | AI scientist | NotebookLM
[Agentic RL] [Env] 16 Docker容器沙盒,Jupyter Kernel 创建有状态的 CI(代码解释器)环境,实现 SWE-Vision
[LLM + RL] kimi 1.5 论文导读与 highlights