Исследования
Здесь — самостоятельные исследования участников сообщества: разборы тем, по которым пока мало внятных публикаций, и эксперименты, проверяющие конкретные гипотезы. Это не обзор по верхам и не быстрый автоматический пересказ источников: за каждым материалом стоит осмысленная работа — авторы сами собирают данные, проверяют их на практике и приходят к выводам, которых до них никто не сформулировал. Если у вас есть такое исследование, расскажите о нем через форму обратной связи.
Маркировка ИИ-изображений
Авторы: Степан Леонтьев, Евдокия Шматина
Источник: публикация
О чем исследование: Препринт о том, как маркируются сгенерированные нейросетями изображения и какой у этих меток правовой статус. По закону автором может быть только человек, чисто машинная генерация авторства не порождает, а российские суды в эту тему пока почти не углубляются. В ЕС же EU AI Act уже требует встраивать в сгенерированный контент машиночитаемую метку о реальном происхождении контента.
Авторы разбирают два технических подхода:
Открытый «паспорт контента» C2PA (криптоподпись и история правок, прикрепленные к файлу, но легко теряющиеся при пересохранении или загрузке в соцсеть);
SynthID от Google — невидимое клеймо в самих пикселях, переживающее сжатие, кадрирование и снятие водяных знаков.
Они проверили, как метки ведут себя в реальности (редактирование, кроп, скриншоты, «обнуление» водяных знаков) и как это может работать в спорах об авторском праве и «степени смешения». Главный вывод:
технология, задуманная ради прозрачности и защиты человека, легко превращается в инфраструктуру контроля и монополии — например, позволяет платформе безошибочно узнавать свой контент и приоритетно его показывать.
Почему это ценно: тема на стыке права и технологий, по которой на русском языке еще нет комплексных материалов. Главная польза прикладная: метки уже можно технически считывать, и крупные платформы начинают их учитывать — значит, на них можно опираться в претензиях, договорах и внутренних политиках работы с дизайнерами.
Отдельно важна взвешенная оптика авторов: они показывают не только пользу прозрачности, но и ее обратную сторону — как тот же механизм становится инфраструктурой контроля и потенциальной монополии. Это тот случай, когда работа не пересказывает чужие тексты, а визионерски формулирует практическую и этическую рамку.
Локальные модели на домашней видеокарте
Автор: Ян Стригов
Источник: Атлас локальных моделей — сайт с результатами; анонс и вторая серия тестов в чате сообщества
О чем исследование: Ян разбирался, какую локальную модель ставить в агента для задач «на подхвате», если в распоряжении обычная домашняя видеокарта — RTX 5070 Ti с 16 Гб видеопамяти. Сравниваются не модели как таковые, а профили запуска: одни и те же веса с разным квантованием (степенью сжатия), размером контекстного окна, шаблоном диалога и распределением слоев между видеокартой и оперативной памятью. В последней серии — 14 текстовых конфигураций семейств Qwen и Gemma, включая файнтьюны, плюс отдельно тернарная Bonsai 27B.
Каждый профиль проходит набор из 42 заданий: код, логика, вызов инструментов, следование инструкциям и русский язык. Отдельно — задачи на длинный контекст, распознавание изображений и русские транскрипты на глубине 8, 32 и 64K.
Главные наблюдения:
Единого победителя нет: лидеры разные в зависимости от того, что важнее — балл, длина окна или запас видеопамяти, и вместо пьедестала автор дает группы с пересекающимися диапазонами;
Русский язык — слабое место почти у всех: от 0/6 до 5/6 решенных заданий, у большинства 1/6;
Один прогон — это снимок: на повторах результат гуляет на 3—7 заданий из 42, сильнее всего у моделей с рассуждением;
Размер не определяет скорость: 26-миллиардная Gemma генерирует в 2,6 раза быстрее 35-миллиардных моделей.
Почему это ценно: локальный запуск — главный ответ на вопрос о конфиденциальности: данные не покидают компьютер. Но между «можно запустить локально» и «этим можно работать» лежит пропасть, о которой публичные бенчмарки молчат — они меряют флагманов на серверных стойках, а не то, что влезает в домашнюю карту. Атлас закрывает ровно этот разрыв: показывает, на что годятся модели, доступные без спецжелеза, и предупреждает про русский язык, который у большинства из них проседает.
Отдельно ценна методическая честность. Автор прямо говорит, что тесты составляла нейросеть, перечисляет дефекты первой версии — слишком строгий проверяющий модуль, обрыв ответа по лимиту токенов, ошибочное задание — и делит результаты на строгие, сокращенные и условные, не выдавая один прогон за истину.
Legal AI Benchmarking: как оценивать юридический ИИ
Автор: Екатерина Якуненко
Источник: цикл статей в блоге Delay RAG: часть 1 — как это делают там (14.07.2026), часть 2 — вендоры (28.07.2026), часть 3 — методика (22.09.2026)
О чем исследование: Цикл отвечает на вопрос, как проверить, насколько хорошо ИИ решает юридические задачи, и почему одного итогового балла для этого мало. В первых двух частях разобрано, как это делают на западном рынке: независимые бенчмарки Vals AI и Legalbenchmarks.ai и собственные замеры вендоров — Harvey, Isaacus, Thomson Reuters. Третья часть посвящена методике: что включать в замер, почему задачи лучше строить по сценариям работы, а не по отраслям права, и какие параметры делают задачу сложной — противоречивые источники, действие закона во времени, материалы неструктурированных форматов на входе. Отдельно разобрано, как оценивать ответы (рубрики, попарное сравнение, настройка и валидация ИИ-судьи) и что из бенчмарка публиковать.
Главные наблюдения:
Если продукт не раскрывает, какая модель у него внутри (а это почти все российские продукты), результат замера невоспроизводим: вендор может сменить модель на следующий день;
Бенчмарк говорит только о тех задачах, которые в него включены, а узкий набор задач может вводить в заблуждение;
ИИ-судьи надежны на коротких ответах и ненадежны на длинных; выход — рубрики, то есть атомарные утверждения, которые проверяются ответом «да» или «нет», поэтому качество судьи зависит от рубрик, а не от мощности модели;
Метрики полезнее показывать в разрезах — по сценариям, отраслям права, источникам сложности, — а не одним сводным баллом;
Любой результат — снимок на момент замера, поэтому бенчмарк должен регулярно обновляться;
Внутренний бенчмарк, который никто не видит, легко становится инструментом самоуспокоения.
Почему это ценно: На российском рынке много внешне похожих юридических ИИ-сервисов, а независимых публичных замеров, по которым их можно сравнить, почти нет. Цикл собирает на русском языке мировой опыт бенчмаркинга юридического ИИ и методику, которую можно применить у себя. Выводы пригодятся, даже если вы не собираетесь строить бенчмарк: при выборе сервиса проверяйте его на своих сценариях, а не по общему баллу, сравнивайте с обычными ChatGPT и Claude и уточняйте, какая модель у продукта внутри. В цикле также разобраны ограничения, характерные для российского рынка: дорогая экспертная разметка и эталоны, которые быстро устаревают из-за частых изменений законодательства.
Связанные статьи
Как внести вклад в Базу знаний — предложить материал или исправление
Теги: #исследования #проекты-участников #ии-контент #авторское-право #локальные-модели #бенчмарки