(
self,
tokenizer: PreTrainedTokenizerBase,
num_requests: int,
max_loras: Optional[int] = None,
lora_path: Optional[str] = None,
**kwargs,
)
| 980 | return data.values.tolist() |
| 981 | |
| 982 | def sample( |
| 983 | self, |
| 984 | tokenizer: PreTrainedTokenizerBase, |
| 985 | num_requests: int, |
| 986 | max_loras: Optional[int] = None, |
| 987 | lora_path: Optional[str] = None, |
| 988 | **kwargs, |
| 989 | ) -> list[SampleRequest]: |
| 990 | samples = [] |
| 991 | data = self._sample_loaded_data(num_requests=num_requests) |
| 992 | for i in range(num_requests): |
| 993 | input_len = int(data[i][2]) |
| 994 | output_len = int(data[i][3]) |
| 995 | vocab_size = tokenizer.vocab_size |
| 996 | # Generate a synthetic prompt: a list of token IDs computed as (i + |
| 997 | # j) modulo vocab_size. |
| 998 | token_ids = [(i + j) % vocab_size for j in range(input_len)] |
| 999 | prompt = tokenizer.decode(token_ids) |
| 1000 | samples.append( |
| 1001 | SampleRequest( |
| 1002 | prompt=prompt, |
| 1003 | prompt_len=input_len, |
| 1004 | expected_output_len=output_len, |
| 1005 | )) |
| 1006 | return samples |
| 1007 | |
| 1008 | |
| 1009 | # ----------------------------------------------------------------------------- |
nothing calls this directly
no test coverage detected