(self, hidden_size=None, num_layers=None, kernel_size=None, num_heads=None)
| 34 | |
| 35 | class FFT(FastspeechDecoder): |
| 36 | def __init__(self, hidden_size=None, num_layers=None, kernel_size=None, num_heads=None): |
| 37 | super().__init__(hidden_size, num_layers, kernel_size, num_heads=num_heads) |
| 38 | dim = hparams['residual_channels'] |
| 39 | self.input_projection = Conv1d(hparams['audio_num_mel_bins'], dim, 1) |
| 40 | self.diffusion_embedding = SinusoidalPosEmb(dim) |
| 41 | self.mlp = nn.Sequential( |
| 42 | nn.Linear(dim, dim * 4), |
| 43 | Mish(), |
| 44 | nn.Linear(dim * 4, dim) |
| 45 | ) |
| 46 | self.get_mel_out = Linear(hparams['hidden_size'], 80, bias=True) |
| 47 | self.get_decode_inp = Linear(hparams['hidden_size'] + dim + dim, |
| 48 | hparams['hidden_size']) # hs + dim + 80 -> hs |
| 49 | |
| 50 | def forward(self, spec, diffusion_step, cond, padding_mask=None, attn_mask=None, return_hiddens=False): |
| 51 | """ |
no test coverage detected