Function_phase_b_dtile_kernel(
I_P_kv_ptr,
A_ptr,
I_P_z_ptr,
B_ptr,
decay_ptr,
M_fwd_ptr,
z_fwd_ptr,
M_rev_
diffusion/model/ops/fused_gdn_chunkwise.py:943
Function_phase_b_kernel(
I_P_kv_ptr,
A_ptr,
I_P_z_ptr,
B_ptr,
decay_ptr,
M_fwd_ptr,
z_fwd_ptr,
M_rev_
diffusion/model/ops/fused_gdn_chunkwise.py:636
Function_precompute_inv_rmsCompute 1/RMS for one component of QKV over the full C = H*D channel dim. Args: qkv: (B, N, 3, H, D) idx: 0 for Q, 1 for K, 2 for
diffusion/model/ops/fused_gdn.py:134
Function_sdpa_unmasked_with_padRun ``F.scaled_dot_product_attention(q, k, v)`` with FA-friendly head_dim padding. FlashAttention-2 only supports head_dim in {32, 64, 128, 256}.
diffusion/model/nets/sana_gdn_camctrl_blocks.py:139
Functionablation_sampler(
net,
latents,
class_labels=None,
cfg_scale=None,
feat=None,
randn_like=torch.randn_l
diffusion/model/edm_sample.py:88
Functionapply_droppath(
network: nn.Module,
drop_prob: float,
linear_decay=True,
scheduled=True,
skip=0,
)
diffusion/model/dc_ae/efficientvit/models/nn/drop.py:44
Functionattention(
q,
k,
v,
q_lens=None,
k_lens=None,
dropout_p=0.0,
softmax_scale=None,
q_scal
diffusion/model/wan/attention.py:237
Functionblock_sparse_attention q: [B, Lq, Nq, C1]. k: [B, Lk, Nk, C1]. v: [B, Lk, Nk, C2]. Nq must be divisible by Nk. q_lens
diffusion/model/wan/attention.py:140