Как выбирать LLM

Не существует «лучшей» нейросети — есть подходящая для задачи или ситуации. Здесь — две оси выбора: по свойствам задачи и по вашим возможностям и ограничениям, — и как читать бенчмарки, на которые ссылаются разработчики.

Дата составления: 2026-09-27
Статус: 💡 Актуально


Свойства задачи → на что смотреть в модели

Выбор стоит начинать не с рейтингов, а с задачи. У каждой свои требования к модели: где-то решает объем документов, где-то поиск по интернету и риск выдуманных ссылок, где-то стиль письма. Ниже — типовые задачи юриста и то, на что при каждой из них смотреть.

  • Очень длинный документ или массив документов → размер контекстного окна и поведение модели на длинном тексте.

    • Заявленное окно порядка 1 миллиона токенов сейчас есть почти у всех ведущих моделей — и у фронтирных, и у китайских (DeepSeek, Qwen, Kimi), поэтому по этому числу их уже не различить. Смотреть стоит на другое: насколько качественно модель работает с длинным текстом (эффективный размер окна обычно заметно меньше заявленного) и сколько контекста реально доступно на вашем тарифе — в бесплатных версиях окно часто урезано. Подробнее — в статье «Контекстное окно».

  • Поиск судебной практики или нормы права → веб-поиск и склонность модели к галлюцинациям.

    • Иллюстративный кейс: участница сообщества Нейросети | ilovedocs Юлия Вербицкая протестировала 9 нейросетей на задаче поиска судебной практики: две из них выдумали несуществующие дела, лучшим по надежности оказался DeepSeek. Вывод автора — нейросеть не заменяет справочно-правовую систему, но полезна как «второй пилот» для анализа уже найденных материалов. Критическая проверка ссылок обязательна — подробнее в статье «Галлюцинации».

  • Расшифровка аудио → мультимодальность и допустимая длина файла. Лидирует Google AI Studio.

  • Составление длинной позиции, заключения, договорной правки → характер модели.

    • По наблюдениям коллеги чаще выбирают Claude или Gemini: у Claude позиции получаются более развернутыми, у Gemini — более компактными.

  • Работа со строго заданным набором источников (книга, набор постановлений, переписка, материалы дела) → инструменты типа Gemini Notebook (NotebookLM). Они отвечают только по загруженному, а не «из себя», что снижает риск выдуманных ссылок. Gemini Notebook можно подключать к харнессам — агентным средам вроде Claude Cowork; готовые плагины и MCP-серверы для этого собраны на странице Плагины и MCP сообщества.

  • Быстрая консультация, переформулирование, редактура → подойдет любая модель из «большой тройки» или GigaChat / Алиса AI.

  • Работа с чувствительными данными, которые не должны уходить за рубеж → российские модели (GigaChat, Алиса AI) или локальный запуск.


Ограничения → какой набор моделей реалистичен

Вторая ось — ваши обстоятельства: бюджет, доступ из России, требования к данным. Они нередко сужают выбор сильнее, чем сама задача, поэтому их стоит учесть до того, как сравнивать модели по качеству.

  • Бюджет = 0 → практически все перечисленные в обзоре сервисы предоставляют бесплатный доступ к веб-чату.

    • Но в бесплатных тарифах американских и европейских моделей контекстное окно и количество запросов жестко ограничены — длинный документ туда, скорее всего, не поместится, а после нескольких запросов вас переведут на более слабую подмодель.

    • Исключение — китайские модели (DeepSeek, Qwen, Kimi): у них бесплатные лимиты заметно щедрее, а контекстное окно сразу большое. Если задача требует длинного контекста и бюджет нулевой — стоит начинать с них, с Gemini Notebook или с Google AI Studio (бесплатны модели Flash-класса, модели Pro-класса с весны 2026 года платные).

  • Нет средств маскировки IP-адреса, нет иностранных средств оплаты → российские модели; DeepSeek; некоторые китайские модели через посредников; Perplexity — доступен без средств маскировки IP-адреса, но платная подписка требует иностранных средств оплаты.

  • Данные не должны уходить за рубеж → российские модели или локальный запуск. Если же вы сами работаете в европейской юрисдикции и вам важно соответствие GDPR — Mistral.

  • Хочется одной подпиской закрыть большую часть задач → одна из «большой тройки» по вкусу плюс при необходимости специализированный инструмент (Perplexity или Gemini Notebook).


Бенчмарки: что это и как их читать

Бенчмарк (benchmark) — стандартный набор задач с заранее известными ответами или критериями оценки. На нем прогоняют модели, чтобы сравнить их между собой. Результаты бенчмарков разработчики приводят в анонсах новых моделей: это те самые таблицы и графики с процентами.

Какие бывают

  • Знания и рассуждение — экзаменационные вопросы от университетского до экспертного уровня: GPQA, Humanity's Last Exam.

  • Математика и программирование — исследовательские математические задачи и исправление реальных ошибок в коде: FrontierMath, SWE-bench.

  • Агентные задачи — работа в терминале и браузере, управление компьютером: Terminal-Bench, OSWorld, BrowseComp. На них сейчас делают главный акцент в анонсах.

  • Длинный контекст — умение найти и связать нужное в очень длинном тексте: MRCR.

  • Профессиональные задачи — реальные рабочие поручения, которые оценивают специалисты: GDPval (44 профессии, в том числе юристы).

  • Предпочтения людей — пользователи вслепую сравнивают ответы двух моделей и голосуют за лучший: Arena (бывшая LMArena).

  • Сводные индексы — объединяют много бенчмарков в один балл, например индекс Artificial Analysis.

Как читать результаты

  • Кто замерял. Цифры из анонса разработчик получает сам, на выбранных им бенчмарках и в лучших для модели условиях. Независимые замеры надежнее: Arena, Artificial Analysis, Epoch AI.

  • В каких условиях. Модели часто тестируют на максимальной глубине размышления, с инструментами и несколькими попытками. В обычном чате с настройками по умолчанию результат будет ниже. На агентных задачах одна и та же модель в разной обвязке, то есть в разном харнессе, показывает заметно разные результаты.

  • Не утекли ли задачи. Если вопросы бенчмарка попали в обучающие данные модели (контаминация, contamination), она вспоминает ответ, а не решает задачу. Поэтому старым открытым бенчмаркам можно доверять меньше, а обновляемым и закрытым — больше.

  • Не уперся ли бенчмарк в потолок. Когда все ведущие модели набирают 90% и выше, бенчмарк перестает их различать (насыщение, saturation), и разница в пару процентов ничего не значит. В рейтингах вроде Arena соседние места тоже часто разделяет статистический шум.

  • Про что задачи. Бенчмарк говорит только о тех задачах, которые в него включены. Высокий балл в программировании или математике ничего не сообщает о том, как модель напишет претензию по российскому праву.

Что есть для юристов

Юридических бенчмарков мало, и почти все построены на задачах по американскому и европейскому праву: независимые замеры Vals AI и Legalbenchmarks.ai, агентный бенчмарк Harvey LAB. Их обзор — в цикле «Legal AI Benchmarking» в блоге Екатерины Якуненко.

По российскому праву открытых и регулярно обновляемых бенчмарков пока нет. Поэтому главный инструмент выбора — собственная проверка на своих задачах.


Совет, который не устаревает

Сначала попробуйте на собственных задачах «большую тройку» (Claude, ChatGPT, Gemini) плюс Perplexity и DeepSeek. Это бесплатно в базовых тарифах, и за пару дней вы получите гораздо более точное понимание, какая модель подходит именно вам, чем из любого обзора. В этом случае ваши личные впечатления — это лучший бенчмарк. Только потом имеет смысл оформлять платную подписку — и, скорее всего, не на ту модель, на которую вы бы подписались до этого эксперимента.


Связанные статьи

Дополнительные материалы


Теги: #инструкция #обзор #новичок