Як штучний інтелект може деанонімізувати користувачів в Інтернеті
Вступ до дослідження
AI-інженер Саймон Лермен разом з колегами презентували дослідження під назвою «Large-Scale Online Deanonymization with LLMs», в якому оцінювали можливості великих мовних моделей (LLM) у встановленні особистості користувачів на основі анонімних постів на різних платформах, таких як Hacker News, Reddit та LinkedIn.
Історична перспектива
Ідея деанонімізації не нова. Ще на початку 2000-х років професор Гарвардського університету Латанья Суїні зазначила, що 87% населення США можна ідентифікувати лише на основі трьох параметрів: поштового індексу, статі та дати народження. Проте trадомісткий процес збору даних залишався складним завданням безпосередньо для аналітиків до появи LLM.
Процес деанонімізації за допомогою LLM
Згідно з дослідженням, LLM здатні прискорити та автоматизувати процес деанонімізації, роблячи це економічно ефективно. Спочатку модель витягує непрямі відомості з коментарів користувачів. Використовуючи техніку пошуку на основі ембеддінгів, вона формує пул з 100 найбільш ймовірних кандидатів.
На фінальному етапі LLM аналізує дані та обирає найкращий варіант збігу. Так, у тесті серед 338 користувачів Hacker News, модель правильно ідентифікувала 226 з 338 випадків (67%), з точністю 90% у тих випадках, де відповідь була надана.
Експерименти і результати
В іншому експерименті, дослідники штучно «розбили» історію одного Reddit-акаунта на фрагменти, що знову стало можливим використовувати LLM для відновлення зв’язків між ними. Поєднання ембеддінгів та логічного аналізу продемонструвало значні результати в порівнянні з базовими методами, що використовують метадані.
Автори застосували результати дослідження до бази даних у 100 мільйонів користувачів, що вказує на потенційні загрози в разі достатніх обчислювальних потужностей.
Ризики та зловживання
Дослідження також зазначає реальні сценарії зловживання, які можуть статися внаслідок технології деанонімізації. Потенційні загрози включають використання державами для переслідування журналістів та активістів, а корпораціями для створення надзвичайно точних рекламних профілів. Крім того, зловмисники можуть застосувати ці знання для соціальної інженерії та фішингу.
Оцінка досліджень
Незважаючи на значні результати, у мережі зауважують, що деанонімізація за непрямими ознаками відома давно. Частина користувачів вказує на обмеженість експериментів, зазначаючи, що LLM не створюють нових загроз, а тільки автоматизують вже існуючі методики.
Висновок
Дослідження Лермана та його команди підкреслює важливість використання LLM у контексті особистих даних і деанонімізації. Технології зростають у потужності, а отже, й ризики, пов’язані із зловживаннями, також можуть зростати. Це ставить на порядок денний нові етичні та правові питання, які потребують термінового обговорення в суспільстві.
