Functionvk_mm_relu_bwd_kernel Input: grad_vk: (B, H, C+1, C), fp32 k: (B, N, H, C), fp16 v: (B, N, H, C), fp16 k_relu_mask: (B, N, H, C), bool
diffusion/model/nets/fastlinear/modules/triton_lite_mla_kernels/vk_mm_relu_bwd.py:51
Functionvk_q_mm_divide_fwd_kernel_fp32(
# Pointers to matrices
a_ptr,
b_ptr,
c_ptr,
c_mid_ptr,
# Matrix dimensions
B,
diffusion/model/nets/fastlinear/modules/triton_lite_mla_kernels/vk_q_mm_divide_fwd.py:60
Functionvk_q_mm_relu_bwd_kernel Input: grad_vk_q: (B, N, H, C+1), fp32 vk: (B, H, C+1, C), fp32 q: (B, N, H, C), fp16 q_relu_mask: (B, N, H, C),
diffusion/model/nets/fastlinear/modules/triton_lite_mla_kernels/vk_q_mm_relu_bwd.py:51