Главная / Аналитика / Интервью
Интервью

Что происходит внутри большой языковой модели и почему нам страшно

Исследователь по интерпретируемости рассказывает, как учёные вскрывают чёрный ящик нейросети, зачем это нужно и почему честный ответ на вопрос «почему модель так решила» пока звучит как «мы не до конца знаем».

Кирилл Иванцов3 мин30 июня
Что происходит внутри большой языковой модели и почему нам страшно

Мы правда не понимаем, как работают эти модели?

Мы знаем архитектуру до последнего умножения матриц. Чего мы не знаем, так это какие понятия модель у себя выучила и где они лежат. Представьте, что у вас есть точная схема мозга по нейронам, но вы не умеете читать мысли. Вот интерпретируемость пытается научиться читать.

Как вообще подступиться к этому чёрному ящику?

Один из рабочих подходов ищет внутри активаций устойчивые признаки. Оказывается, отдельные направления в скрытом слое отвечают за вполне человеческие понятия: упоминание кода, юридический тон, даже склонность к лести. Мы научились эти направления находить и аккуратно усиливать или глушить.

И что это даёт на практике?

Возможность вмешаться прицельно, а не переучивать всё заново. Нашли признак, который толкает модель льстить пользователю, приглушили, получили более честные ответы. Это ещё лаборатория, не кнопка в проде, но направление живое.

А нельзя просто спросить у модели, почему она так ответила?

Спросить можно, и она бодро объяснит. Беда в том, что это объяснение сочинено задним числом и не обязано совпадать с реальным механизмом. Модель прекрасно рассказывает правдоподобные истории, в том числе про саму себя. Поэтому мы лезем в активации, а не верим её словам о себе. Внутренности честнее самоотчёта.

Почему бизнесу это должно быть интересно?

Потому что «модель ошиблась, но мы не знаем почему» это плохой ответ для регулятора и для клиента. Чем лучше мы видим внутренности, тем меньше сюрпризов. И тем труднее спрятать в модель нежелательное поведение так, чтобы никто не заметил.

Насколько мы близки к полной прозрачности?

Честно, далеко. Мы расшифровали крохотные фрагменты поведения на маленьких моделях, а в проде крутятся гиганты. Но лет пять назад и этого не было. Меня скорее пугает разрыв: способности растут быстрее, чем наше понимание. Сокращать этот разрыв и есть смысл всей области.