General

CharXiv

CharXiv: realistic chart understanding for multimodal LLMs, built from real arXiv figures. 1,000 validation charts, each with four descriptive questions (19 fixed templates) and one free-form reasoning question. Models are scored per (model, question); reasoning is exact-match, descriptive is GPT-4o-graded against a rubric.

5,000items
37subjects
CC-BY-SA-4.0license
reasoningdomain
imagemodality
textmodality
item-level responses released
Saturation status: Unknown

Response matrix

Fit to width. Hover for subject & item; click a cell for details.

CharXiv response matrix: AI models (rows) against items (columns)
Correct (1)Incorrect (0)Unobserved

Scale: 1 = correct · 0 = incorrect

Subjects

  1. 1Claude-3-5-Sonnet0.7964
  2. 2GPT-4o0.7698
  3. 3GPT-4V-Turbo0.7136
  4. 4InternVL2-Pro0.6949
  5. 5InternVL2-76B0.6792
  6. 6GPT-4o-mini0.6676
  7. 7Gemini-1-5-Pro0.6624
  8. 8Claude-3-Sonnet0.654
  9. 9Claude-3-Opus0.6329
  10. 10Claude-3-Haiku0.5846
  11. 11InternVL2-26B0.566
  12. 12Ovis1.5-Gemma2-9B0.5582
  13. 13Phi-3-Vision0.547
  14. 14Ovis1.5-Llama3-8B0.5392
  15. 15Cambrian-34B0.5324
  16. 16InternVL-Chat-V1-50.5265
  17. 17MiniCPM-V2-50.5245
  18. 18Reka-Flash0.5051
  19. 19Reka-Core0.5028
  20. 20InternLM-XComposer2-4KHD0.4872
  21. 21Gemini-1.0-Pro-Vision0.4807
  22. 22Mini-Gemini-HD-Yi-34B0.4716
  23. 23LLaVA-1-6-Yi-34B0.4536
  24. 24DeepSeek-VL0.4008
  25. 25Mini-Gemini-HD-LLaMA3-8B0.3938
  26. 26Qwen-VL-Max0.3812
  27. 27IDEFICS-2-Chatty0.3682
  28. 28VILA-1-5-40B0.3574
  29. 29InternLM-XComposer20.3476
  30. 30MiniCPM-V20.324
  31. 31Reka-Edge0.3163
  32. 32LLaVA-1-6-Mistral-7B0.3116
  33. 33IDEFICS-20.2986
  34. 34SPHINX-V2-13B0.2744
  35. 35MoAI0.2647
  36. 36Qwen-VL-Plus0.2635