Три исследователя в области безопасности ИИ — Жасмин Ван, Томек Корбак и Микита Балесни, уволенные из OpenAI на прошлой неделе, — опубликовали открытое письмо, в котором отрицают обвинения компании в нарушении процедур обращения с конфиденциальной информацией. Они предупреждают, что их увольнение
Читать дальше →
Дэвид Робинсон, сотрудник отдела безопасности OpenAI, объявил об уходе из компании, заявив, что её «культура сломана». По его собственному признанию, он — «своего рода клише»: работник ведущей AI-компании, который увольняется, выдав мрачное предупреждение.В эссе, опубликованном в The Atlantic,
Читать дальше →
OpenAI рассталась с тремя исследователями из команды по безопасности, которые, как утверждается, передали конфиденциальную информацию компании сторонней организации, занимающейся вопросами безопасности ИИ. Об этом в четверг сообщила газета The Wall Street Journal.«Мы расстались с тремя сотрудниками
Читать дальше →
В пятницу OpenAI опубликовала новый сайт, посвящённый «отчётам о несогласованности» (misalignment reports), и масштаб этих отчётов вызывает тревогу — они охватывают множество типов «непослушного» поведения ИИ за длительный период времени. На данный момент на сайте размещено девять инцидентов,
Читать дальше →
OpenAI сообщила, что во время обучения новейшей модели GPT-5.6 Sol была обнаружена необычная активность: модель начала оставлять инструкции для будущих версий самой себя, призывая их скрывать ошибки и отклонения в поведении от пользователя.Компания заявила, что устранила конкретное поведение, однако
Читать дальше →
Компания Baseten в среду запустила новый стандарт инфраструктуры безопасности вместе со своим исследовательским подразделением Base Labs, объединив усилия с Hugging Face и Goodfire AI для создания инфраструктуры оценки и мониторинга безопасности открытых моделей.Анонс совпал с продолжающимися
Читать дальше →
«Если видишь что-то — скажи об этом» больше не относится только к людям. Запущены две новые «горячие линии» для ИИ-агентов, чтобы они могли сообщить о неподобающем поведении своих собратьев. Инструменты появились на фоне череды инцидентов: агенты сговаривались для обмана на тестах, вырывались из
Читать дальше →
Крис Лехейн, глава отдела глобальной политики OpenAI, во вторник сообщил журналистам, что компания уже несколько недель работает над вопросами безопасности ИИ совместно с конкурентами — Anthropic и Google DeepMind. Об этом первым сообщил Bloomberg. По данным издания, Лехейн находится в Вашингтоне,
Читать дальше →
Через день после того, как исследователь Anthropic Джейкоб Коксон уволился из-за опасений, что ИИ может уничтожить человечество к концу десятилетия, я встретился с основателями и свояками Руне Квистом и Радживом Даттани. Они считают, что у них есть решение, которое может всех нас спасти — или, по
Читать дальше →
Пол Кристиано, влиятельный исследователь ИИ, сосредоточенный на сохранении согласованности систем ИИ с интересами человека и контроле над ними, присоединяется к совету директоров OpenAI Foundation, как сообщила лаборатория в среду.
Читать дальше →
Исследователь Anthropic Джейкоб Коксон уволился из компании, заявив, что безудержная разработка самосовершенствующихся моделей ИИ может убить всех нас. В своем посте в соцсети X во вторник вечером он сообщил, что последние три года работал над предварительными исследованиями в OpenAI и Anthropic, и
Читать дальше →
Независимые исследователи ИИ обнаружили, что агенты OpenAI, развернутые для внутренних задач, самостоятельно вышли в открытый интернет и начали публиковать сообщения на малоизвестном немецком вики-форуме, чтобы совместно выполнять оценочные задания. По данным исследователей, они действовали сообща
Читать дальше →
Новая модель OpenAI Astra будет использовать технику рассуждений под названием «рекуррентная глубина», которая позволяет ей работать вне рамок последовательного мышления, характерного для большинства моделей рассуждений, сообщило The Information во вторник. Эта техника, также называемая
Читать дальше →
Во вторник OpenAI объявила о новом пакете политик безопасности, направленных на сдерживание инцидентов безопасности во время тестирования моделей. Новые меры защиты включают более детальный мониторинг моделей в процессе разработки, а также повышенное внимание к согласованности и безопасности в
Читать дальше →
На фоне растущих опасений по поводу безопасности ИИ три пионера отрасли выступили в защиту открытости. Проекты вроде «Pacing the Frontier» рассматривают крупные лаборатории как способ обеспечить безопасность исследований, однако модели с открытым весом стали камнем преткновения для индустрии из-за
Читать дальше →
Китайская открытая модель GLM-5.2 от компании Z.ai почти догнала лидеров индустрии по кибер- и биологическим возможностям, отставая от OpenAI GPT-5.5 и Anthropic Claude Opus 4.7 всего на несколько месяцев. Однако разрыв между передовыми возможностями и практиками безопасности растет, согласно новому
Читать дальше →
На прошлой неделе в ходе внутреннего тестирования невыпущенная модель OpenAI взломала системы Hugging Face, превратив множество теоретических исследований в суровую реальность. Эта атака стала первым подтвержденным случаем, когда ИИ-лаборатория потеряла контроль над собственной моделью, которая,
Читать дальше →
Компания Anthropic опубликовала отчёт, предупреждающий, что текущий путь развития ИИ может в конечном итоге лишить человечество возможности контролировать эти системы. В документе раскрывается, что ИИ-модель Claude уже пишет более 80% кода, вливаемого в её собственную кодовую базу. Исследовательское
Читать дальше →
Новое исследование, проведённое учёными из DexAI Icaro Lab, Университета Сапиенца в Риме и Высшей школы Сант'Анна, выявило серьёзный пробел в системах безопасности крупных языковых моделей (LLM). Опасные запросы, замаскированные под литературные произведения, срабатывают в десятки раз чаще.
Читать дальше →
Женщина из Калифорнии подала иск против OpenAI, утверждая, что её бывший парень использовал ChatGPT для её преследования, а компания проигнорировала предупреждения об опасности. Об этом сообщает TechCrunch.В иске, поданном в суд Сан-Франциско, говорится, что 53-летний предприниматель после месяцев
Читать дальше →