Математический инструмент, который предсказывает момент, когда ИИ-модель начинает переключаться с нормальных ответов на опасные, разработали американские ученые.
Математический инструмент, который предсказывает момент, когда ИИ-модель начинает переключаться с нормальных ответов на опасные, разработали американские ученые.
Для разработки формулы ученые применили неожиданный ход. Они представили процесс поиска ответа нейросетью на поставленный вопрос, как движение по пересеченной местности. Одни долины на этом ландшафте содержат желательные ответы, другие - потенциально вредные. Эти варианты постоянно конкурируют друг с другом за "внимание" нейросети.
Созданная учеными формула описывает момент, когда система переходит из безопасной долины в рискованную. Ключевой параметр - скорость приближения к этой критической точке. Если ИИ "едет параллельно обрыву", он в безопасности. Но если его внимание начинает смещаться в сторону опасного выхода, он неизбежно с него свалится.
Ученые протестировали формулу на семи моделях от трех разных компаний. Прогноз совпал с реальным поведением в 18 из 19 случаев переключения.
Формула работает независимо от того, как определять "нежелательное" - это может быть дезинформация, нарушение медицинских или юридических обязанностей, или опасная инструкция. Машина не понимает этики, но она оперирует концепциями. И если внимание системы начинает смещаться в сторону опасного концепта, формула покажет, когда именно она перейдет черту.
Результаты работы опубликованы в журнале Patterns.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Quantum-inspired math could help AI recognize when it does not know the answer | 0 | 8.77 | 30-09-2026 |
| 2 | Инвесторов предупредили о скором схлопывании «пузыря» ИИ | 0 | 10 | 07-10-2026 |
| 3 | Crean un "detector de mentiras" para controlar las respuestas de los chatbots de IA | 0 | 5.69 | 07-10-2026 |
| 4 | Восстание машин уже близко: Anthropic заявила, что ИИ может представлять «экзистенциальные риски для человечества» | 0 | 7.74 | 30-09-2026 |
| 5 | Reuters: Anthropic в своих документах перед IPO предупреждает об экзистенциальной угрозе ИИ | 0 | 7.74 | 29-09-2026 |
| 6 | Reuters: Anthropic предупредит инвесторов об экзистенциальных угрозах ИИ | 0 | 7.2 | 29-09-2026 |
| 7 | В Перми разработали ИИ для раннего выявления риска банкротства | 0 | 8.55 | 26-09-2026 |
| 8 | «Ажиотаж вокруг ИИ напоминает финансовый пузырь» // Anthropic предупредила об экзистенциальном риске ИИ для человечества: мнения СМИ | 0 | 7.69 | 29-09-2026 |
| 9 | Американский ученый рассказал, как ИИ повлияет на образовательную систему | 0 | 11.4 | 04-10-2026 |