↓ 1 callersMethodprepare_flexattention(
self,
cfg_size,
num_head,
head_dim,
dtype,
device,
c
diffusion/model/nets/sana_multi_scale_video_camctrl.py:1226
↓ 1 callersFunctionproj_divide_bwd Input: grad_y: (B, N, H*C) proj_weight: (H*C, H*C) vk_q: (B, N, H, C+1) Output: grad_vk_q: (B, N, H, C+1)
diffusion/model/nets/fastlinear/modules/triton_lite_mla_kernels/proj_divide_bwd.py:252
↓ 1 callersFunctionrun_cuda_camCUDA cam path: reads q/k/v [B,H,D,N] directly, writes fp32 [B,H,D,N] directly (no packing, no transpose). Phase B via Triton (skip_z). reuse_
diffusion/model/ops/fused_gdn_chunkwise_cuda.py:923