Путь к безопасному ИИ: исследователь из MIT предлагает математически доказывать безопасность кода

Путь к безопасному ИИ: исследователь из MIT предлагает математически доказывать безопасность кода Учёный и исследователь в области искусственного интеллекта Макс Тегмарк. © Getty Images
Макс Тегмарк предлагает альтернативный подход к созданию безопасных алгоритмов.

Физик и исследователь искусственного интеллекта Макс Тегмарк из Массачусетского технологического института (Massachusetts Institute of Technology, MIT) представил новый метод контроля нейронных сетей на семинаре Института чистой и прикладной математики (Institute for Pure & Applied Mathematics, IPAM). Вместо изучения сложной внутренней структуры ИИ он предлагает математически проверять понятный код, который система генерирует сама.

В своём выступлении учёный обозначил два пути достижения «надёжного ИИ». Первый — сложная, медленно развивающаяся наука о механистической интерпретируемости, которая пытается досконально изучить работу нейронных сетей изнутри. Второй, кардинально иной подход заключается не в проверке самого «черного ящика» ИИ, а в формальной верификации программного кода, который ИИ способен самостоятельно экспортировать из своих знаний.

Геометрия возникает в результате обобщения

Тегмарк объяснил, что способность нейросетей к обобщению возникает благодаря тому, что они самостоятельно открывают изящные геометрические структуры в процессе обучения. Например, при решении задач на модульное сложение или при работе с днями недели внутри сети формируется круг, числа от 0 до 99 выстраиваются в трехмерную спираль, а географические понятия складываются в виртуальную карту мира. Этот процесс исследователь называет «интеллектом через голодание».

«Если у вас очень ограниченные ресурсы, возможно, единственный способ выполнить интеллектуальную задачу — это найти разумный способ её решения», — объяснил профессор логику работы нейросетей.

Модульность и автоматический экспорт кода

Ученые также работают над повышением модульности нейросетей, чтобы их структура больше напоминала человеческий мозг, где разные зоны отвечают за отдельные задачи. Благодаря определенным изменениям в настройках обучения ИИ начинает разбивать вычисления на отдельные независимые модули, что позволяет исследователям находить математические формулы внутри системы.

Команде Тегмарка уже удалось создать алгоритмы, которые автоматически анализируют эту внутреннюю структуру (например, операции бинарного сложения) и преобразуют её в понятный человеку код на языке Python.

Последствия для разработки и безопасности ИИ

Для разработки программного обеспечения и безопасности ИИ это означает возможный переход к новой парадигме. Вместо того чтобы безуспешно пытаться понять каждый параметр в гигантских нейросетях, разработчики могут позволить ИИ функционировать как «чёрный ящик», требуя взамен экспортировать изученные алгоритмы в виде читаемого кода на языке Python или на языке для формальной верификации Lean.

Этот подход перекликается с концепцией vibe coding («вайб-кодирования»), где ИИ берет на себя генерацию логики, а человек сосредотачивается на архитектуре и проверке. Формальная верификация такого автоматически сгенерированного кода позволит математически доказать его безопасность и надёжность перед использованием, полностью обходя проблему непрозрачности самой нейронной сети.

Для Европейского Союза этот подход приобретает особое значение на фоне внедрения Закона об искусственном интеллекте (AI Act). Математическая проверка сгенерированного кода поможет разработчикам соответствовать регуляторным требованиям к надежности систем без чрезмерных затрат. Это позволит медиа- и технологическим компаниям безопасно использовать современные алгоритмы, минимизируя риски неконтролируемого поведения систем.

Ограничения и предостережения

Несмотря на оптимизм, Тегмарк предупредил, что часть озвученных тезисов пока остается гипотезами, а не окончательными выводами. Во внутренней геометрии сетей до сих пор фиксируется много «шума» и непонятных аномалий — например, ИИ иногда строит неточные фигуры вместо идеальных пропорций или неоправданно дублирует одни и те же алгоритмы. Кроме того, на данный момент нет четкого пути масштабирования такого автоматического экспорта кода на современные крупные языковые модели без принципиально новых решений.

Заметили ошибку?

Пожалуйста, выделите ее мышкой и нажмите Ctrl+Enter или Отправить ошибку

Добавить комментарий
Всего комментариев: 0
Текст содержит недопустимые символы
Осталось символов: 2000
Пожалуйста выберите один или несколько пунктов (до 3 шт.) которые по Вашему мнению определяет этот комментарий.
Пожалуйста выберите один или больше пунктов
Нецензурная лексика, ругань Флуд Нарушение действующего законодательства Украины Оскорбление участников дискуссии Реклама Разжигание розни Признаки троллинга и провокации Другая причина Отмена Отправить жалобу ОК
Оставайтесь в курсе последних событий!
Подписывайтесь на наш канал в Telegram
Следить в Телеграмме