V8 evaluation suite

Measure retrieval and routing instead of trusting demos.

The benchmark suite contains judged queries with expected intents topics and relevant evidence. V8 reports classifier accuracy MRR and recall@5 so regressions are visible.

6cases
50%intent accuracy
0.00MRR
0%recall@5
queryintenttopicfirst relevant rank
compare q learning and contextual banditscomparereinforcement-learningmiss
explain bm25 for ragdefinitionnlp-retrievalmiss
how do i debug a prisma database connectiondebugdata-sciencemiss
build a reinforcement learning study planhowtoreinforcement-learningmiss
what is a transformer architectureprojectdeep-learningmiss
how does tf idf represent texthowtonlp-retrievalmiss