Rulvar API reference / @rulvar/evals / BenchmarkReport
Interface: BenchmarkReport
Defined in: packages/evals/src/benchmark.ts:181
Properties
| Property | Type | Description | Defined in |
|---|---|---|---|
costUsd? | BenchmarkPercentiles | - | packages/evals/src/benchmark.ts:190 |
fingerprint | BenchmarkFingerprint | - | packages/evals/src/benchmark.ts:205 |
judgeCostUsd | number | - | packages/evals/src/benchmark.ts:195 |
metrics | Record<string, BenchmarkPercentiles> | Percentiles per named extractor, over scored runs. | packages/evals/src/benchmark.ts:192 |
name | string | - | packages/evals/src/benchmark.ts:182 |
refusal? | { atOrdinal: number; detail: string; } | Present when the aggregate envelope refused a TARGET run before it started (cycle 81): the series ends there and every completed repeat stays on the report, mirroring the eval suite's monotone refusal instead of a throw destroying the paid evidence. Judge refusals never appear here; they reject their own run as 'judge:refused'. | packages/evals/src/benchmark.ts:204 |
refusal.atOrdinal | number | - | packages/evals/src/benchmark.ts:204 |
refusal.detail | string | - | packages/evals/src/benchmark.ts:204 |
repeats | number | Repeats attempted (equals runs.length). | packages/evals/src/benchmark.ts:184 |
runs | BenchmarkRunRecord[] | - | packages/evals/src/benchmark.ts:187 |
scored | number | Runs that entered the percentile series. | packages/evals/src/benchmark.ts:186 |
totalCostUsd | number | Every target and judge run, scored or rejected (honest spend). | packages/evals/src/benchmark.ts:194 |
wallMs? | BenchmarkPercentiles | Absent when no run scored: the kit never fabricates a series. | packages/evals/src/benchmark.ts:189 |