📊 Бенчмарки LLM: почему 90% на MMLU — это ещё не повод выбирать модель Каждый раз, когда выходит новая языковая модель, мы видим цифры: «90% на MMLU», «Elo 1350 в Chatbot Arena». Это бенчмарки — стандартизированные экзамены для LLM. Но за красивыми числами скрывается много нюансов. 🔸 Бенчмарк ≠ метрика. Метрика отвечает «как измерять», бенчмарк — «через что прогнать модель». 🔸 Ни один бенчмарк не скажет, подойдёт ли модель вашей задаче. Он даёт первичную ориентацию, но финальный выбор — только на собственных данных. Что искажает результаты: ❌ Загрязнение данных. Вопросы бенчмарка попадают в обучающую выборку — модель не решает, а вспоминает. Из-за этого OpenAI отказался от SWE-bench Verified. ❌ Переобученность. Модели натаскивают под MMLU: 90% на нём, но на свежих аналогах — проседание. ❌ Чувствительность к промпту. Та же модель может показать 40% в zero-shot и 80% в few-shot. ❌ Self-reported scores. Цифры от вендора — наименее надёжный источник. Вендор контролирует все переменные и выбирает выгодные настройки. Как читать лидерборды: ✅ Сравнивайте модели одного размера ✅ Игнорируйте разницу в 1-2% — это статистический шум ✅ Не доверяйте насыщенным бенчмаркам (топ-модели на плато 85-90%) ✅ Предпочитайте слепые площадки — Chatbot Arena Elo надёжнее формальных тестов ✅ Валидируйте на своих данных — это главное правило Подробно об этом читайте тут: https://agaltsovav.ru/docs/ai/llm-benchmarks/