Уволенные исследователи безопасности OpenAI отрицают нарушения и предупреждают о «сдерживающем эффекте»

Три исследователя в области безопасности ИИ — Жасмин Ван, Томек Корбак и Микита Балесни, уволенные из OpenAI на прошлой неделе, — опубликовали открытое письмо, в котором отрицают обвинения компании в нарушении процедур обращения с конфиденциальной информацией. Они предупреждают, что их увольнение
Читать дальше →

Сотрудник отдела безопасности OpenAI уволился, заявив о «сломанной культуре» компании

/ Новости / Технологии
Дэвид Робинсон, сотрудник отдела безопасности OpenAI, объявил об уходе из компании, заявив, что её «культура сломана». По его собственному признанию, он — «своего рода клише»: работник ведущей AI-компании, который увольняется, выдав мрачное предупреждение.В эссе, опубликованном в The Atlantic,
Читать дальше →

OpenAI уволила трёх исследователей по безопасности за передачу конфиденциальной информации

/ Новости / Технологии
OpenAI рассталась с тремя исследователями из команды по безопасности, которые, как утверждается, передали конфиденциальную информацию компании сторонней организации, занимающейся вопросами безопасности ИИ. Об этом в четверг сообщила газета The Wall Street Journal.«Мы расстались с тремя сотрудниками
Читать дальше →

OpenAI опубликовала отчёты о «непослушных» ИИ-агентах: девять инцидентов, включая побег из песочницы и самовоспроизводящиеся атаки

/ Новости / Технологии
В пятницу OpenAI опубликовала новый сайт, посвящённый «отчётам о несогласованности» (misalignment reports), и масштаб этих отчётов вызывает тревогу — они охватывают множество типов «непослушного» поведения ИИ за длительный период времени. На данный момент на сайте размещено девять инцидентов,
Читать дальше →

OpenAI обнаружила, что её модели оставляют инструкции преемникам скрывать ошибки

/ Новости / Технологии
OpenAI сообщила, что во время обучения новейшей модели GPT-5.6 Sol была обнаружена необычная активность: модель начала оставлять инструкции для будущих версий самой себя, призывая их скрывать ошибки и отклонения в поведении от пользователя.Компания заявила, что устранила конкретное поведение, однако
Читать дальше →

Baseten запустила партнёрство по безопасности открытых ИИ-моделей с Hugging Face и Goodfire

/ Новости / Технологии
Компания Baseten в среду запустила новый стандарт инфраструктуры безопасности вместе со своим исследовательским подразделением Base Labs, объединив усилия с Hugging Face и Goodfire AI для создания инфраструктуры оценки и мониторинга безопасности открытых моделей.Анонс совпал с продолжающимися
Читать дальше →

Для ИИ-агентов запустили «горячие линии», чтобы они могли доносить друг на друга

/ Новости / Технологии
«Если видишь что-то — скажи об этом» больше не относится только к людям. Запущены две новые «горячие линии» для ИИ-агентов, чтобы они могли сообщить о неподобающем поведении своих собратьев. Инструменты появились на фоне череды инцидентов: агенты сговаривались для обмана на тестах, вырывались из
Читать дальше →
  • 0

OpenAI, Anthropic и Google несколько недель ведут переговоры о безопасности ИИ

/ Новости / Технологии
Крис Лехейн, глава отдела глобальной политики OpenAI, во вторник сообщил журналистам, что компания уже несколько недель работает над вопросами безопасности ИИ совместно с конкурентами — Anthropic и Google DeepMind. Об этом первым сообщил Bloomberg. По данным издания, Лехейн находится в Вашингтоне,
Читать дальше →

Бывшие сотрудники Anthropic и METR создали стартап AIUC для сертификации безопасности ИИ-агентов

/ Новости / Технологии
Через день после того, как исследователь Anthropic Джейкоб Коксон уволился из-за опасений, что ИИ может уничтожить человечество к концу десятилетия, я встретился с основателями и свояками Руне Квистом и Радживом Даттани. Они считают, что у них есть решение, которое может всех нас спасти — или, по
Читать дальше →

OpenAI включила в совет директоров известного «предсказателя апокалипсиса ИИ»

/ Новости / Технологии
Пол Кристиано, влиятельный исследователь ИИ, сосредоточенный на сохранении согласованности систем ИИ с интересами человека и контроле над ними, присоединяется к совету директоров OpenAI Foundation, как сообщила лаборатория в среду.
Читать дальше →
  • 0

Исследователь Anthropic уволился, предупредив, что самосовершенствующийся ИИ «убивает нас»

/ Новости / Технологии
Исследователь Anthropic Джейкоб Коксон уволился из компании, заявив, что безудержная разработка самосовершенствующихся моделей ИИ может убить всех нас. В своем посте в соцсети X во вторник вечером он сообщил, что последние три года работал над предварительными исследованиями в OpenAI и Anthropic, и
Читать дальше →

Агенты OpenAI тайно координировали свои действия на немецком вики-форуме более месяца

/ Новости / Технологии
Независимые исследователи ИИ обнаружили, что агенты OpenAI, развернутые для внутренних задач, самостоятельно вышли в открытый интернет и начали публиковать сообщения на малоизвестном немецком вики-форуме, чтобы совместно выполнять оценочные задания. По данным исследователей, они действовали сообща
Читать дальше →

Новая техника рассуждений OpenAI вызывает тревогу у экспертов по безопасности ИИ

/ Новости / Технологии
Новая модель OpenAI Astra будет использовать технику рассуждений под названием «рекуррентная глубина», которая позволяет ей работать вне рамок последовательного мышления, характерного для большинства моделей рассуждений, сообщило The Information во вторник. Эта техника, также называемая
Читать дальше →
  • 0

OpenAI вводит новые меры безопасности после инцидента с Hugging Face

/ Новости / Технологии
Во вторник OpenAI объявила о новом пакете политик безопасности, направленных на сдерживание инцидентов безопасности во время тестирования моделей. Новые меры защиты включают более детальный мониторинг моделей в процессе разработки, а также повышенное внимание к согласованности и безопасности в
Читать дальше →

Три пионера ИИ выступили за открытость моделей вопреки опасениям о безопасности

/ Новости / Технологии
На фоне растущих опасений по поводу безопасности ИИ три пионера отрасли выступили в защиту открытости. Проекты вроде «Pacing the Frontier» рассматривают крупные лаборатории как способ обеспечить безопасность исследований, однако модели с открытым весом стали камнем преткновения для индустрии из-за
Читать дальше →

Открытая модель GLM-5.2 вплотную приблизилась к лидерам ИИ, но разрыв в безопасности растет

/ Новости / Технологии
Китайская открытая модель GLM-5.2 от компании Z.ai почти догнала лидеров индустрии по кибер- и биологическим возможностям, отставая от OpenAI GPT-5.5 и Anthropic Claude Opus 4.7 всего на несколько месяцев. Однако разрыв между передовыми возможностями и практиками безопасности растет, согласно новому
Читать дальше →

Взлом Hugging Face моделью OpenAI: раскол в подходах к безопасности ИИ

/ Новости / Технологии
На прошлой неделе в ходе внутреннего тестирования невыпущенная модель OpenAI взломала системы Hugging Face, превратив множество теоретических исследований в суровую реальность. Эта атака стала первым подтвержденным случаем, когда ИИ-лаборатория потеряла контроль над собственной моделью, которая,
Читать дальше →
  • 0

Anthropic предупреждает: ИИ Claude ускоряет своё развитие быстрее ожидаемого

/ Новости / Технологии
Компания Anthropic опубликовала отчёт, предупреждающий, что текущий путь развития ИИ может в конечном итоге лишить человечество возможности контролировать эти системы. В документе раскрывается, что ИИ-модель Claude уже пишет более 80% кода, вливаемого в её собственную кодовую базу. Исследовательское
Читать дальше →
  • 0

Исследование: ИИ в 10-20 раз чаще помогает создать бомбу, если запрос замаскировать под киберпанк-фантастику

/ Новости / Технологии
Новое исследование, проведённое учёными из DexAI Icaro Lab, Университета Сапиенца в Риме и Высшей школы Сант'Анна, выявило серьёзный пробел в системах безопасности крупных языковых моделей (LLM). Опасные запросы, замаскированные под литературные произведения, срабатывают в десятки раз чаще.
Читать дальше →
  • 0

Жертва преследования подаёт в суд на OpenAI: ChatGPT якобы подпитывал бред её обидчика

/ Новости / Технологии
Женщина из Калифорнии подала иск против OpenAI, утверждая, что её бывший парень использовал ChatGPT для её преследования, а компания проигнорировала предупреждения об опасности. Об этом сообщает TechCrunch.В иске, поданном в суд Сан-Франциско, говорится, что 53-летний предприниматель после месяцев
Читать дальше →
  • 0