Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Original file line number Diff line number Diff line change
@@ -0,0 +1,81 @@
{
"run_id": "20260726T185553Z",
"judge_scores": {
"q199-graphrag-faithfulness": 1.0,
"q199-graphrag-answer_relevancy": 0.8347400935056873,
"q186-raptor-faithfulness": 1.0,
"q186-raptor-answer_relevancy": 0.85198688099497,
"q149-contextual-faithfulness": 1.0,
"q149-contextual-answer_relevancy": 0.8077504963301628,
"q149-raptor-faithfulness": 1.0,
"q149-raptor-answer_relevancy": 0.9460890444439526,
"q057-graphrag-faithfulness": 0.5,
"q057-graphrag-answer_relevancy": 0.0,
"q228-parent_child-faithfulness": 1.0,
"q228-parent_child-answer_relevancy": 0.6856243446899631,
"q188-graphrag-faithfulness": 1.0,
"q188-graphrag-answer_relevancy": 0.8336470959717595,
"q057-sac_contextual-faithfulness": 1.0,
"q057-sac_contextual-answer_relevancy": 0.8387442659907304,
"q129-hybrid_rrf-faithfulness": 1.0,
"q129-hybrid_rrf-answer_relevancy": 0.9124998734589621,
"q017-hybrid_rrf-faithfulness": 1.0,
"q017-hybrid_rrf-answer_relevancy": 0.7206135051759966,
"q017-hybrid_rrf-abstention": 1.0,
"q228-dense-faithfulness": 0.8571428571428571,
"q228-dense-answer_relevancy": 0.6870679326468675,
"q188-sac-faithfulness": 1.0,
"q188-sac-answer_relevancy": 0.8327270764043573,
"q162-sac-faithfulness": 1.0,
"q162-sac-answer_relevancy": 0.7749749305427135,
"q091-raptor-faithfulness": 1.0,
"q091-raptor-answer_relevancy": 0.9702814665461529,
"q091-raptor-abstention": 1.0,
"q147-reranked-faithfulness": 1.0,
"q147-reranked-answer_relevancy": 0.9533329415627246,
"q029-sac-faithfulness": 1.0,
"q029-sac-answer_relevancy": 0.8552758720163123,
"q086-contextual-faithfulness": 1.0,
"q086-contextual-answer_relevancy": 0.9940291063255439,
"q152-dense-faithfulness": 1.0,
"q152-dense-answer_relevancy": 0.8740158431078623,
"q053-contextual-faithfulness": 1.0,
"q053-contextual-answer_relevancy": 0.8949108045847701,
"q160-hybrid_rrf-faithfulness": 1.0,
"q160-hybrid_rrf-answer_relevancy": 0.7715785879645054,
"q011-reranked-faithfulness": 1.0,
"q011-reranked-answer_relevancy": 0.8502438689143164,
"q057-sac-faithfulness": 1.0,
"q057-sac-answer_relevancy": 0.9170167453202009,
"q129-contextual-faithfulness": 1.0,
"q129-contextual-answer_relevancy": 0.9112467674362174,
"q190-parent_child-faithfulness": 0.3333333333333333,
"q190-parent_child-answer_relevancy": 0.782537101530835,
"q190-parent_child-abstention": 1.0,
"q228-sac_contextual-faithfulness": 0.6666666666666666,
"q228-sac_contextual-answer_relevancy": 0.7052906182663375,
"q011-dense-faithfulness": 1.0,
"q011-dense-answer_relevancy": 0.7049204363155358,
"q129-raptor-faithfulness": 0.9230769230769231,
"q129-raptor-answer_relevancy": 0.9081927270706781,
"q017-raptor-faithfulness": 1.0,
"q017-raptor-answer_relevancy": 0.7381427478477991,
"q017-raptor-abstention": 1.0,
"q024-contextual-faithfulness": 1.0,
"q024-contextual-answer_relevancy": 0.9541869181118697,
"q193-raptor-faithfulness": 0.5,
"q193-raptor-answer_relevancy": 0.8704297565744411,
"q123-hybrid_rrf-faithfulness": 1.0,
"q123-hybrid_rrf-answer_relevancy": 0.8033356630688374,
"q205-sac_contextual-faithfulness": 1.0,
"q205-sac_contextual-answer_relevancy": 0.7516688618687585,
"q093-hybrid_rrf-faithfulness": 1.0,
"q093-hybrid_rrf-answer_relevancy": 0.7226008284858803,
"q187-graphrag-faithfulness": 1.0,
"q187-graphrag-answer_relevancy": 0.5653568713203554,
"q128-hybrid_rrf-faithfulness": 0.8571428571428571,
"q128-hybrid_rrf-answer_relevancy": 0.8334048457508137,
"q107-dense-faithfulness": 1.0,
"q107-dense-answer_relevancy": 0.931451117336013
}
}
19 changes: 19 additions & 0 deletions datasets/regrag-br/calibration/archive/20260726T185553Z/README.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,19 @@
# Legacy calibration workspace

This directory preserves the attempted calibration workspace derived from run
`20260726T185553Z` for audit history only.

The run predates evidence schema v1 and does not contain the exact ordered
`judge_contexts` used by the Faithfulness judge. The worksheet reconstructs
cited source excerpts instead, so neither it nor the sealed scores are eligible
for judge calibration. Do not fill these labels or use this workspace to report
agreement.

Original artifact SHA-256 values at archival time:

- `worksheet.md`: `f7ff210d12f7265049cc4cd741d9b0a9f22e520eaefe04fcfb9fc0fbc234ffaa`
- `labels.json`: `b11eae0437820ac3578c8389a2ef63613b6fa17b45f1eddccb24abd00e5133ca`
- `.judge-sealed.json`: `af5ed04f740bf3799b0f55ebde36e68a54e3afa2dcb04a1ff134b1d0f621aaf9`

A future eligible run must generate a fresh workspace directly under
`datasets/regrag-br/calibration/` with `build_calibration_worksheet.py`.
Loading