Фото: Getty Images
Статистика моделей ИИ Llama 4 вводит пользователей в заблуждение
Для рекламы публичной версии искусственного интеллекта использовали статистику недоступной экспериментальной версии.
На выходных Meta выпустила две новые модели искусственного интеллекта Llama 4 - легкую Scout и среднеформатную Maverick, которая, по словам компании, превосходит GPT-4o и Gemini 2.0 Flash в широком спектре популярных тестов. Но, как оказалось, статистика от Meta вводит пользователей в заблуждение, сообщает The Verge.
В пресс-релизе по поводу выпуска моделей ИИ Meta подчеркнула их отличный результат в рейтинге LMArena - платформе, где пользователи сравнивают ИИ-модели в режиме чата и голосуют за лучшие. Согласно информации компании, Maverick заняла второе место с ELO-рейтингов 1417 - выше GPT-4o от OpenAI и лишь немного позади Gemini 2.5 Pro.
Однако пользователи заметили примечание в документации Meta, где указано, что тестировалась не публичная модель, а экспериментальная версия, специально оптимизированная для разговорного взаимодействия. Компания не сообщила об этом сразу, а лишь позже подтвердила, что использовался кастомизированный вариант - Llama-4-Maverick-03-26-Experimental, созданный для лучшего впечатления в чате.
В ответ руководство LMArena обвинило Meta в том, что она не соответствует их ожиданиям от поставщиков ИИ-моделей, и уже начали обновлять свои правила, чтобы избежать подобных ситуаций в будущем. В компании считают, что когда поставщики могут предоставлять специально настроенные версии своих моделей для тестирования, одновременно выпуская совсем другие для общественности, такие рейтинги, как LMArena, становятся менее значимыми как индикаторы реальной производительности.
Напомним, ранее сообщалось, что новый тест для искусственного интеллекта не проходит ни одна модель ИИ.
Cloudflare создала ИИ для обмана ботов, которые собирают информацию для ИИ
Новости от Корреспондент.net в Telegram и WhatsApp. Подписывайтесь на наши каналы https://t.me/korrespondentnet и WhatsApp