首页
番剧
直播
游戏中心
会员购
漫画
赛事
投稿
【CUDA进阶】Cutlass软件抽象分层与源码浅析(已完结)
2.1万
21
2025-04-16 21:43:57
未经作者授权,禁止转载
252
177
607
50
课程总结
收起全部章节
关闭课程总结
暂无课程总结
程序员
软件
计算机
预告片
设计
编程
代码
源码
比飞鸟贵重的多_HKL
发消息
自然选择号!前进四!!!!
关注 3.4万
比飞鸟贵重的多_HKL
17/80
UP主的全部视频
加载中...
【OpenCodeFS】3.异步编程与多轮对话
1256播放
【OpenCodeFS】2.从Python到TypeScript
2033播放
【OpenCodeFS】1.将你的OpenCode打造成一个有原则的助教
2275播放
【课程预告】OpenCodeFromScratch带你复现OpenCode源码
2928播放
【CUDA进阶】Cutlass软件抽象分层与源码浅析(已完结)
【Cutlass】0.预告
【Cutlass】0.预告
19:46
【Cutlass】1.开发环境配置
03:59
【Cutlass】2.gemm分层
14:32
【Cutlass】3.数据空间申请与传输
14:57
【Cutlass】4.gemm计算流程(device部分)
13:25
【Cutlass】5.编译期计算thread size
13:23
【Cutlass】6.gemm计算流程(kernel部分)
08:48
【Cutlass】7.gemm计算流程(threadblock部分)
15:07
【Cutlass】8.gemm计算流程(warp部分)
08:42
【Cutlass】9.epilogue部分讲解
12:48
【CUDA进阶】MMA分析Bank Conflict与Swizzle(已完结)
1.7万播放
0.预告
06:18
【MMA】1.mma介绍(与wmma有什么不同)
14:10
【MMA】2.ldmatrix函数介绍
21:57
【MMA】3.ldmatrix数据搬运验证
09:23
【MMA】4.mma函数介绍
07:46
【MMA】5.bank conflit分析
20:46
【MMA】6.通过padding解决bank conflit
08:07
【MMA】7.bank conflict再分析
04:33
【MMA】8.mma搭配wmma实现矩阵乘法计算
08:41
【MMA】9.swizzle原理讲解
16:35
【MMA】10.swizzle实现思路讲解
21:53
【CUDA进阶】Tensor Core实战教程(已完结)
2.0万播放
0.课程预告
11:39
1.开发环境搭建
07:02
2.【cublas】cublasGemmEx易错点指出
08:42
3.【cublas】cublasGemmEx详解
12:23
4.【wmma】wmma api介绍与v1_naive_kernel
20:44
5.【wmma】v2_mma4x2_kernel
11:05
6.【wmma】v3_mma4x2_warp2x4_kernel
05:03
7.【wmma】v4_mma4x2_warp2x4_double_buffer
20:42
OpenManus源码调试带读,透过Manus学习Agent!
2.3万播放
【OpenManus】0.预告&演示
11:24
【OpenManus】1.Manus类解析
19:05
【OpenManus】2.LLM构造
06:55
【OpenManus】3.BaseAgent讲解
08:08
【OpenManus】4.ReActAgent讲解
21:38
【OpenManus】5.Search相关讲解
04:58
【OpenManus】6.下一轮ReAct
09:47
Flash Attention学习过程【详】解(已完成!)
6.2万播放
【Flash Atten】0.预告
04:48
【Flash Atten】1.寻找切入点
14:16
【Flash Atten】2.libtorch环境搭建
21:22
【Flash Atten】3.三个矩阵相乘合并
14:56
【Flash Atten】4.naive&safe softmax
08:36
【Flash Atten】5.online softmax(重制版)
17:38
【Flash Atten】6.online softmax与value的点积优化
15:37
【Flash Atten】7.cuda算子解析
18:00
【Flash Atten】8.疑惑与思考(请认真听很关键!)
26:24
【大模型部署】8bit量化算子解析(已完结!)
1.2万播放
【大模型部署】8bit量化算子解析(更新中~)
23:49
【PYTHON端量化权重】 1.权重量化代码解析
16:03
【PYTHON端量化权重】 2.权重量化代码解析
22:00
【PYTHON端量化权重】 3.权重量化总结
10:00
【GET_ROWS】主要讲解如何在cpp中进行反量化
10:48
【未量化算子】rms_norm和mul算子
03:10
【MUL_MAT】1.主要讲解如何在cpp中进行量化
11:11
【MUL_MAT】2.量化版本的矩阵乘法原理
07:28
【MUL_MAT】3.量化版本矩阵乘法思路解析
09:20
【MUL_MAT】4.量化版本矩阵乘法代码讲解
14:12
【大模型部署】llama.cpp大模型算子源码详解(已完结~)
1.4万播放
【准备工作】环境配置
07:59
【GET_ROWS】1. 程序定位
15:07
【GET_ROWS】2. Tensor索引讲解
12:34
【GET_ROWS】3. 算子讲解
12:49
【RMS_NORM】1.python端算子梳理
04:37
【RMS_NORM】2. 算子讲解
11:13
【MUL】1.广播规则
04:48
【MUL】2.Tensor维度折叠
02:44
【MUL】3.算子详解
11:29
【MAT_MUL】算子解析(只是调用一个库函数)
08:42
【ROPE】1.旋转位置编码如何计算
06:06
【ROPE】2.旋转位置编码python实现流程
08:50
【ROPE】3. 算子讲解
12:43
【维度变换算子】1.建图绘制
09:50
【维度变换算子】2.pytorch实现
04:25
【维度变换算子】3.reshape算子原理
05:07
【维度变换算子】4.view算子原理
02:44
【维度变换算子】5.permute算子原理
07:27
【CPY】 算子解析
07:03
【BATCH_MAT_MUL】1.算子原理讲解
10:02
【BATCH_MAT_MUL】2.算子实现讲解
10:00
【SOFTMAX】1.算子原理讲解
04:32
【SOFTMAX】2.算子代码实现
08:40
【CONT】算子原理与实现
03:21
【SILU】算子原理与实现
05:17
【大模型部署】llama.cpp源码逐行调试带读!(已完结~)
6.3万播放
【0】预告
10:40
【1】环境配置
06:37
【2】加载后端详解
27:38
【3】llama_model结构体介绍
08:43
【4】gguf文件解析
28:16
【5】构建llama_model_load
09:20
【6】构建llama_model
14:40
【7】构建cpu与gpu的buffer type
22:15
【8】为input/output/layers分配buft
10:25
【9】create_tensor函数详解
30:34
【10】为weight分配内存
25:57
【11】数据搬运
07:34
【12】llama_model总结
16:53
【13】llama_context概述
18:33
【14】分配kv_cache
06:32
【15】scheduler申请内存
14:32
【15重置】scheduler概述与内存申请
09:10
【16】构建计算图
21:11
【17】为所有节点分配后端
15:39
【18】graph的拆分
11:54
【19】sheduler内部图的构建
12:18
【20】 计算内存分配 (完结撒花)
16:51
【CUDA调优指南】Shared Memory与Bank Conflicts
5894播放
【CUDA调优指南】Roofline Model详解
8029播放
roofline_model_1
12:46
roofline_model_2
12:56
roofline_model_3
09:20
【CUDA调优指南】Warp调度与Transpose
3232播放
warp_transpose_1
18:00
warp_transpose_2
09:09
【CUDA调优指南】Warp Scheduler讲解
7800播放
warp_scheduler1
19:16
warp_scheduler2
27:37
【CUDA调优指南】Occupancy Calculater
6568播放
occupancy_1
16:54
occupancy_2
07:17
occupancy_3
07:26
occupancy_4
10:23
【CUDA调优指南】合并访存与Transpose
5963播放
合并访存与Transpose_1
20:32
合并访存与Transpose_2
30:15
【CUDA调优指南】缓存&访存流程
7367播放
缓存&访存流程1
11:54
缓存&访存流程2
16:59
缓存&访存流程3
22:07
【CUDA调优指南】合并访存
1.3万播放
【CUDA调优指南】合并访存1
37:03
【CUDA调优指南】合并访存2
21:08
【CUDA调优指南】Nsight Compute与Kernel调优指南预告
1.6万播放
【CUDA】Sgemm单精度矩阵乘法(已完结~)
3.5万播放
【SGEMM】预告
07:05
【SGEMM】框架搭建与cpu串行实现
19:20
【SGEMM】使用global memory实现sgemm
13:26
【SGEMM】使用shared memory实现sgemm
19:21
【SGEMM】shared memory+sliding window
11:34
【SGEMM】增加每个线程的工作量
34:49
【SGEMM】使用float4提升读取效率
40:07
【SGEMM】使用resigter模拟二级缓存(内积转外积)
29:36
【SGEMM】使用resigter模拟二级缓存+float4
22:54
【SGEMM】global_memory转置再存放shared_memory
13:47
【SGEMM】使用double buffer加速矩阵乘法
43:01
【CUDA】硬件与工具探索合集(更新ing)
1.5万播放
【工具合集】如何使用vscode+cmake调试cuda代码
11:32
【硬件基础】NVIDIA GPU算力计算
07:18
【硬件基础】NVIDIA GPU带宽计算
12:15
【硬件基础】Warp Divergence
13:27
【硬件基础】Bank Conflict
07:53
【硬件基础】shuffle寄存器数据交换
09:03
【CUDA】Reduce规约求和(已完结~)
4.2万播放
【Reduce】开发环境搭建
16:22
【Reduce】分析reduce代码的设计与实现流程
43:53
【Reduce】使用Shared Memory代替Global Memory
11:12
【Reduce】避免在一个warp中存在分支(no divergence branch)
10:51
【Reduce】消除程序中的bank conflict
09:39
【Reduce】解决idle线程 Plan A
09:37
【Reduce】解决idle线程 Plan B
07:06
【Reduce】展开最后一维减少同步
21:27
【Reduce】循环完全展开
07:25
【Reduce】合理设置block数量
11:56
【Reduce】使用shuffle指令进行寄存器交换
36:17
加载中...
加载中...
小窗
客服
顶部