()
| 170 | logger.info(f"RTC pass rate: {passed_rtc_count / total_examples * 100:.2f}%") |
| 171 | |
| 172 | def main(): |
| 173 | parser = argparse.ArgumentParser(description="Evaluate LLMs on arena-hard-auto dataset using RTC") |
| 174 | parser.add_argument("--model", type=str, required=True, help="OpenAI model to use") |
| 175 | parser.add_argument("--output", type=str, default="rtc_eval_results.json", |
| 176 | help="Output file for results") |
| 177 | |
| 178 | args = parser.parse_args() |
| 179 | |
| 180 | # Create results directory if it doesn't exist |
| 181 | os.makedirs("results", exist_ok=True) |
| 182 | output_file = os.path.join("results", args.output) |
| 183 | |
| 184 | # Run evaluation |
| 185 | evaluate_dataset(args.model, output_file) |
| 186 | |
| 187 | if __name__ == "__main__": |
| 188 | main() |
no test coverage detected