Preference
UltraFeedback
UltraFeedback GPT-4 multi-aspect ratings (1-5) from 17 models on ~64K prompts.
63,932items
17subjects
MITlicense
preferencedomain
textmodality
item-level responses released
Saturation status: Unknown
Response matrix
Fit to width. Hover for subject & item; click a cell for details.

lowhighUnobserved
Scale: {1, 2, 3, 4, 5}
Subjects
- 1gpt-44.4976
- 2gpt-3.5-turbo4.4832
- 3wizardlm-70b4.1458
- 4bard4.1229
- 5vicuna-33b3.9533
- 6llama-2-70b-chat3.9242
- 7mpt-30b-chat3.9231
- 8wizardlm-13b3.9136
- 9llama-2-13b-chat3.7951
- 10ultralm-65b3.7044
- 11ultralm-13b3.6352
- 12wizardlm-7b3.447
- 13llama-2-7b-chat3.4095
- 14starchat3.1498
- 15alpaca-7b2.9765
- 16falcon-40b-instruct2.6021
- 17pythia-12b2.6018