MCPcopy Create free account
hub / github.com/algorithmicsuperintelligence/optillm / main

Function main

scripts/eval_arena_hard_auto_rtc.py:172–185  ·  view source on GitHub ↗
()

Source from the content-addressed store, hash-verified

170 logger.info(f"RTC pass rate: {passed_rtc_count / total_examples * 100:.2f}%")
171
172def main():
173 parser = argparse.ArgumentParser(description="Evaluate LLMs on arena-hard-auto dataset using RTC")
174 parser.add_argument("--model", type=str, required=True, help="OpenAI model to use")
175 parser.add_argument("--output", type=str, default="rtc_eval_results.json",
176 help="Output file for results")
177
178 args = parser.parse_args()
179
180 # Create results directory if it doesn't exist
181 os.makedirs("results", exist_ok=True)
182 output_file = os.path.join("results", args.output)
183
184 # Run evaluation
185 evaluate_dataset(args.model, output_file)
186
187if __name__ == "__main__":
188 main()

Callers 1

Calls 1

evaluate_datasetFunction · 0.85

Tested by

no test coverage detected