Модель Astra от OpenAI: Рискуем ли мы потерять контроль над ИИ?

OpenAI представила новую модель Astra, использующую метод "непрозрачной рекурсии", который вызывает опасения среди экспертов по безопасности ИИ из-за возможного усложнения мониторинга её логики мышления.
Что такое "непрозрачная рекурсия"?
Недавно OpenAI анонсировала свою новую модель Astra, которая использует метод, известный как "непрозрачная рекурсия". Эта техника позволяет модели функционировать вне традиционного последовательного мышления, которое характерно для большинства аналогичных систем. Ход мыслей модели становится менее прозрачным, что вызывает серьёзные опасения у экспертов по безопасности ИИ.
Мнения экспертов
Несмотря на то, что использование этой техники в модели Astra, по сообщениям, ограничено, она уже успела вызвать обеспокоенность среди специалистов в области безопасности. Генеральный директор Redwood, Бак Шлегерис, выразил свои опасения в посте, отметив, что дальнейшее развитие этой технологии может значительно усложнить мониторинг логики мышления модели, что, в свою очередь, может привести к нежелательным последствиям.
Другой эксперт, Зви Мовшовиц, также поделился своим мнением, предложив, что могут потребоваться законодательные меры, чтобы предотвратить "гонку на дно" среди лабораторий ИИ. Он отметил, что использование непрозрачной рекурсии может подорвать усилия по обеспечению мониторинга и верности логики мышления.
Как это влияет на мониторинг модели?
В обычных условиях логика мышления модели последовательно отображает этапы, которые она проходит при решении задачи. Хотя это представление далеко от идеала, оно остаётся полезным инструментом для мониторинга возможных ошибок или несоответствий. При недавних инцидентах с непредсказуемым поведением агентов OpenAI, записи логики мышления помогли понять причины их действий.
Однако в случае непрозрачной рекурсии модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. Это приводит к тому, что следы логики становятся менее очевидными, что затрудняет мониторинг.
Несмотря на это, компания уверяет, что использование этой техники в модели Astra остаётся ограниченным, и логика мышления по-прежнему будет понятной. Главный ученый OpenAI, Якуб Пачоцкий, подчеркнул, что лаборатория продолжает придавать большое значение прозрачности логики мышления и намерена развивать системы мониторинга в рамках своих планов по безопасности.
Тем не менее, многие эксперты остаются настороженными. Глава исследований Redwood, Райан Гринблатт, выразил опасения, что непрозрачная рекурсия может быстро развиваться и полностью лишить возможности мониторинга логики мышления. Он надеется, что OpenAI остановится на этом этапе и не перейдёт к более сложным архитектурам.
«Непрозрачная рекурсия» звучит как название хоррор-фильма
Извините, но дословный перевод "гонка на дно" повеселил))