Preference

UltraFeedback

UltraFeedback GPT-4 multi-aspect ratings (1-5) from 17 models on ~64K prompts.

63,932items
17subjects
MITlicense
preferencedomain
textmodality
item-level responses released
Saturation status: Unknown

Response matrix

Fit to width. Hover for subject & item; click a cell for details.

UltraFeedback response matrix: AI models (rows) against items (columns)
lowhighUnobserved

Scale: {1, 2, 3, 4, 5}

Subjects

  1. 1gpt-44.4976
  2. 2gpt-3.5-turbo4.4832
  3. 3wizardlm-70b4.1458
  4. 4bard4.1229
  5. 5vicuna-33b3.9533
  6. 6llama-2-70b-chat3.9242
  7. 7mpt-30b-chat3.9231
  8. 8wizardlm-13b3.9136
  9. 9llama-2-13b-chat3.7951
  10. 10ultralm-65b3.7044
  11. 11ultralm-13b3.6352
  12. 12wizardlm-7b3.447
  13. 13llama-2-7b-chat3.4095
  14. 14starchat3.1498
  15. 15alpaca-7b2.9765
  16. 16falcon-40b-instruct2.6021
  17. 17pythia-12b2.6018