Software Engineering

ResearchCodeBench

ResearchCodeBench: 212 coding challenges from 20 recent (2024-2025) ML papers. Given the paper plus context code with a blanked snippet, an LLM fills in the missing implementation, graded by curated tests. 32 LLMs evaluated; per-(model, snippet) pass/fail over 6784 observations.

212items
32subjects
MITlicense
software_engineeringdomain
ml_engineeringdomain
textmodality
item-level responses released
Saturation status: Unknown

Response matrix

Fit to width. Hover for subject & item; click a cell for details.

ResearchCodeBench response matrix: AI models (rows) against items (columns)
Correct (1)Incorrect (0)Unobserved

Scale: 1 = correct · 0 = incorrect

Subjects

  1. 1GEMINI_2_5_PRO_PREVIEW_05_060.6415
  2. 2O3_HIGH0.5943
  3. 3GEMINI_2_5_PRO_PREVIEW_03_250.5896
  4. 4OPENROUTER_O4_MINI_HIGH0.5849
  5. 5O3_MINI_HIGH0.5236
  6. 6CLAUDE_3_7_SONNET_2025_02_190.5189
  7. 7GPT_4_10.5
  8. 8CLAUDE_3_5_SONNET_2024_10_220.4858
  9. 9O1_HIGH0.4811
  10. 10DEEPSEEK_R10.4575
  11. 11GEMINI_2_5_FLASH_PREVIEW_04_170.4528
  12. 12GROK_3_BETA0.4292
  13. 13OPENROUTER_DEEPSEEK_CHAT_V3_03240.4245
  14. 14GPT_4_1_MINI0.4245
  15. 15GPT_4O_2024_08_060.4104
  16. 16OPENROUTER_CLAUDE_3_5_HAIKU0.3774
  17. 17GEMINI_2_0_FLASH0.3726
  18. 18OPENROUTER_MISTRAL_MEDIUM_30.3538
  19. 19MISTRAL_CODESTRAL_25010.3349
  20. 20OPENROUTER_COHERE_COMMAND_A0.3113
  21. 21GEMINI_2_0_FLASH_LITE0.3066
  22. 22OPENROUTER_LLAMA_4_MAVERICK0.2736
  23. 23QWEN_2_5_CODER_32B_INSTRUCT0.2594
  24. 24OPENROUTER_AMAZON_NOVA_PRO_1_00.25
  25. 25GPT_4O_MINI0.2311
  26. 26GROK_2_12120.2217
  27. 27GROK_3_MINI_BETA_HIGH0.1981
  28. 28OPENROUTER_LLAMA_4_SCOUT0.184
  29. 29GPT_4_1_NANO0.1509
  30. 30LLAMA_3_3_70B_INSTRUCT0.1226
  31. 31OPENROUTER_QWEN_TURBO0.0802
  32. 32OPENROUTER_MISTRAL_CODESTRAL_MAMBA0.0142