Evaluation API¶
decision_bench.evaluate.run_openrouter_evaluation(examples, output_dir, *, model, reasoning_effort, seed, concurrency, reasoning_family_effort=None, benchmark_metadata=None)
¶
Evaluate rows concurrently with append-only raw output and resumability.
Source code in src/decision_bench/evaluate.py
56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 | |
decision_bench.evaluate.run_jev_openrouter_evaluation(examples, output_dir, *, model, concurrency, max_state_question_tokens=32000, input_token_reserve=2048, tokenizer_model='Qwen/Qwen3-0.6B', tokenizer_revision='c1899de289a04d12100db370d81485cdf75e47ca', benchmark_metadata=None)
¶
Evaluate Jev through OpenRouter's native Decisions endpoint.
Source code in src/decision_bench/evaluate.py
98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 | |
decision_bench.evaluate.run_hf_evaluation(examples, output_dir, *, model_dir, seed, batch_size, max_prompt_characters_per_batch, max_length, attn_implementation, benchmark_metadata=None)
¶
Evaluate a native local HF decision-token checkpoint in CUDA batches.
Source code in src/decision_bench/evaluate.py
274 275 276 277 278 279 280 281 282 283 284 285 286 287 288 289 290 291 292 293 294 295 296 297 298 299 300 301 | |
decision_bench.evaluate.summarize_raw(raw_path)
¶
Aggregate successful raw rows without hiding failures.
Source code in src/decision_bench/evaluate.py
787 788 789 790 791 792 793 794 795 796 797 798 799 800 801 802 803 804 805 806 807 808 809 810 811 812 813 814 815 816 817 818 819 820 821 822 823 824 825 826 827 828 829 830 831 832 833 834 835 836 837 838 839 840 841 842 843 844 845 846 847 848 | |