Reasoning
MMDocRAG
MMDocRAG tests whether models can answer questions about documents by weaving retrieved text and images into a cited answer, which a judge model rates for fluency, citation quality, coherence, reasoning and factuality.
2,000items
68subjects
CC-BY-4.0license
generaldomain
reasoningdomain
imagemodality
textmodality
item-level responses released
Saturation status: No
Response matrix
Loading session strips…
lowhighUnobserved
Scale: {0, 1/25, 2/25, ..., 1} - the LLM judge's mean of five 0-5 quality dimensions, divided by 5; 0.0 and 1.0 are both attainable