Оптический ИИ от UCLA выявляет дипфейки с точностью почти 98%

/ Технологии → Новости / Технологии

Исследователи из Калифорнийского университета в Лос-Анджелесе (UCLA) создали новый оптико-нейронный процессор, использующий свет для быстрого и точного выявления дипфейков. В отличие от традиционных систем, которые обычно анализируют видео поочередно с помощью цифрового оборудования, технология UCLA способна обрабатывать 15 и более видеопотоков одновременно.

Ключевое отличие заключается в том, что часть процесса обнаружения происходит за счет физического распространения света. Это позволяет оценивать множество видео одновременно за один оптический проход, а не пропускать каждое по отдельности через стандартный цифровой конвейер.

Технология описана в исследовании «Масштабируемая энергоэффективная оптико-нейронная архитектура для мультиплексированного обнаружения дипфейк-видео», опубликованном в журнале eLight. Оптическая ИИ-система задумана как высокопроизводительный и устойчивый к атакам первый уровень защиты для проверки больших объемов поддельного и сгенерированного ИИ видео.

Быстрый рост генеративного ИИ делает синтетические видео все более реалистичными, что повышает потребность в точных системах обнаружения, способных работать в больших масштабах. Многие современные детекторы дипфейков требуют огромных объемов цифровых вычислений: один анализ может включать сотни миллиардов операций с плавающей запятой, а видео часто обрабатываются последовательно. Чем больше контента нужно проверить, тем пропорционально растут время обработки и энергозатраты.

У цифровых систем есть и другая проблема: злоумышленники могут намеренно вносить в поддельные видео незаметные изменения, призванные запутать детектор и выдать манипуляцию за подлинник.

Профессор Айтоган Озджан и его команда из UCLA разработали гибридную цифро-оптическую систему, призванную решить обе задачи. Легкий цифровой кодировщик сначала собирает компактную информацию о каждом видео, включая пространственные, спектральные и временные признаки. Эти данные преобразуются в фазовый шаблон и отображаются на программируемом пространственном модуляторе света.

Полученный оптический волновой фронт затем проходит через пассивный оптический декодер на основе свободного пространства. На выходе парные оптические детекторы напрямую выдают оценку подлинности для каждого видео. По сути, система заменяет вычислительно затратную цифровую сеть декодирования физическим процессом, способным обрабатывать множество потоков параллельно.

В экспериментах с видимым светом процессор одновременно исследовал 15 видео из набора Celeb-DF за каждый оптический проход. Средняя точность обнаружения составила 97,79% при чувствительности 99,86% и специфичности 95,72%. Чувствительность показывает, насколько успешно система выявляет манипуляции, и столь высокое значение особенно важно для инструмента, призванного не пропускать подделки. Показатель 99,86% соответствует средней доле ложноотрицательных результатов около 0,14% — иными словами, лишь очень малая часть поддельных видео была ошибочно признана подлинной.

Исследователи также увеличили емкость системы до 18 видео за один оптический проход. Даже при этом средняя точность обнаружения осталась на уровне 96,13%.

Команда выяснила, что процессор можно сделать более мощным, увеличив физическую глубину пассивного оптического декодера без существенного роста энергопотребления или задержки вывода. При добавлении двух оптимизированных пассивных дифракционных слоев во время тестирования на более сложных манипуляциях точность обнаружения выросла примерно на 6,8%. Эти фазовые дифракционные слои можно изготовить как пассивные статические оптические структуры: они выполняют дополнительные вычисления за счет дифракции света и не требуют дополнительной электроэнергии во время вывода.

Такой подход позволяет добиться более сложной обработки без тех энергозатрат, которые обычно сопутствуют крупным цифровым нейросетям.

Исследователи не ограничились классическими дипфейками с подменой лиц. Они также проверили процессор на видео, созданных с помощью модели Google VEO-3. Новые генеративные ИИ-системы способны создавать материалы, лишенные многих очевидных артефактов ранних дипфейков, что делает их более сложной целью для детекторов, обученных в основном на старых видах манипуляций. При минимальной донастройке оптический процессор достиг точности 94,80% и чувствительности 97,61% на ранее не виденных видео VEO-3. Результаты говорят о том, что подход потенциально способен адаптироваться по мере развития генеративного ИИ.

Оптическая система также продемонстрировала устойчивость к черноящичным состязательным атакам и обеспечивает врожденную защиту от белоящичных атак. Частично эта безопасность обусловлена тем, как детектор физически выполняет вычисления: поскольку часть процесса вывода происходит через дифракцию, важные параметры оптической модели фактически встроены в аппаратуру. Их трудно измерить, воспроизвести или обратно спроектировать, что значительно усложняет восстановление детектора и разработку точно подобранных состязательных изменений для его обхода.

Процессор продолжал надежно работать при наличии шума изображения, размытия, JPEG-сжатия и экспериментальных рассогласований. По словам исследователей, эти результаты показывают, как оптические вычисления могут обеспечить более безопасную и надежную основу для некоторых систем искусственного интеллекта.

Процессор UCLA задуман не как замена сложных цифровых детекторов, а как высокочувствительный первый этап более крупной системы обнаружения. Огромные объемы видео могли бы сначала проходить через параллельный оптический процессор, а контент, признанный подозрительным, направлялся бы на более вычислительно затратные цифровые модели для детальной финальной оценки. Такая система объединила бы сильные стороны обоих подходов: оптическая обработка обеспечивает параллельную работу, низкое энергопотребление декодера, высокую чувствительность, устойчивость к состязательным атакам и адаптивность к новым генераторам ИИ-видео, а традиционные цифровые системы — более глубокий анализ при необходимости.

По словам исследователей, это сочетание в перспективе может пригодиться для масштабной модерации контента, проверки подлинности медиа, видеонаблюдения и других критичных для безопасности ИИ-приложений.

Авторы работы — Парниан Гапандар Кашани и доктор Шици Чэнь, внесшие равный вклад, а также профессор Айтоган Озджан. Исследователи связаны с факультетом электротехники и вычислительной техники UCLA, факультетом биоинженерии UCLA и Калифорнийским институтом наносистем.

Источники:


sciencedaily.com

Материалы предоставлены Light Publishing Center, Changchun Institute of Optics, Fine Mechanics And Physics, CAS.

Parnian Ghapandar Kashani, Shiqi Chen, Aydogan Ozcan. Scalable, energy-efficient optical-neural architecture for multiplexed deepfake video detection. eLight, 2026; 6 (1) DOI: 10.1186/s43593-026-00143-y

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии