在 speculative mode 下,测试 Attention 在传入 tree mask 下的功能
(self)
| 379 | ) |
| 380 | |
| 381 | def test_tree_mask(self): |
| 382 | """ |
| 383 | 在 speculative mode 下,测试 Attention 在传入 tree mask 下的功能 |
| 384 | """ |
| 385 | prefill_len = 8192 |
| 386 | dec_len_q = 5 |
| 387 | total_len = prefill_len + dec_len_q |
| 388 | mask = paddle.tril(paddle.ones((self.bsz, dec_len_q, total_len), dtype="float32"), diagonal=prefill_len) |
| 389 | mask[:, 2, prefill_len + 1] = 0 |
| 390 | mask[:, 3, prefill_len + 2] = 0 |
| 391 | mask[:, 4, prefill_len + 1] = 0 |
| 392 | mask[:, 4, prefill_len + 3] = 0 |
| 393 | |
| 394 | mask_ref = paddle.where(mask == 1, paddle.zeros_like(mask), paddle.full_like(mask, fill_value=float("-inf"))) |
| 395 | |
| 396 | mask_append_attn = mask[:, :, prefill_len:] |
| 397 | mask_append_attn = paddle.where( |
| 398 | mask_append_attn == 1, |
| 399 | paddle.full_like(mask_append_attn, fill_value=False, dtype=bool), |
| 400 | paddle.full_like(mask_append_attn, fill_value=True, dtype=bool), |
| 401 | ) |
| 402 | |
| 403 | self.run_append_c16_attention(prefill_len, 0, True) |
| 404 | dec_out = self.run_append_c16_attention(dec_len_q, prefill_len, False, mask_append_attn) |
| 405 | ref_out = self.ref_attention(self.CURRENT_Q[0], self.TOTAL_K, self.TOTAL_V, mask_ref) |
| 406 | np.testing.assert_allclose( |
| 407 | ref_out.astype("float32").numpy(), dec_out.astype("float32").numpy(), rtol=1e-03, atol=5e-03 |
| 408 | ) |
| 409 | |
| 410 | def test_mask_offset(self): |
| 411 | """ |
nothing calls this directly
no test coverage detected