Як штучний інтелект може деанонімізувати користувачів в Інтернеті

Вступ до дослідження

AI-інженер Саймон Лермен разом з колегами презентували дослідження під назвою «Large-Scale Online Deanonymization with LLMs», в якому оцінювали можливості великих мовних моделей (LLM) у встановленні особистості користувачів на основі анонімних постів на різних платформах, таких як Hacker News, Reddit та LinkedIn.

Історична перспектива

Ідея деанонімізації не нова. Ще на початку 2000-х років професор Гарвардського університету Латанья Суїні зазначила, що 87% населення США можна ідентифікувати лише на основі трьох параметрів: поштового індексу, статі та дати народження. Проте trадомісткий процес збору даних залишався складним завданням безпосередньо для аналітиків до появи LLM.

Процес деанонімізації за допомогою LLM

Згідно з дослідженням, LLM здатні прискорити та автоматизувати процес деанонімізації, роблячи це економічно ефективно. Спочатку модель витягує непрямі відомості з коментарів користувачів. Використовуючи техніку пошуку на основі ембеддінгів, вона формує пул з 100 найбільш ймовірних кандидатів.

На фінальному етапі LLM аналізує дані та обирає найкращий варіант збігу. Так, у тесті серед 338 користувачів Hacker News, модель правильно ідентифікувала 226 з 338 випадків (67%), з точністю 90% у тих випадках, де відповідь була надана.

Експерименти і результати

В іншому експерименті, дослідники штучно «розбили» історію одного Reddit-акаунта на фрагменти, що знову стало можливим використовувати LLM для відновлення зв’язків між ними. Поєднання ембеддінгів та логічного аналізу продемонструвало значні результати в порівнянні з базовими методами, що використовують метадані.

Автори застосували результати дослідження до бази даних у 100 мільйонів користувачів, що вказує на потенційні загрози в разі достатніх обчислювальних потужностей.

Ризики та зловживання

Дослідження також зазначає реальні сценарії зловживання, які можуть статися внаслідок технології деанонімізації. Потенційні загрози включають використання державами для переслідування журналістів та активістів, а корпораціями для створення надзвичайно точних рекламних профілів. Крім того, зловмисники можуть застосувати ці знання для соціальної інженерії та фішингу.

Оцінка досліджень

Незважаючи на значні результати, у мережі зауважують, що деанонімізація за непрямими ознаками відома давно. Частина користувачів вказує на обмеженість експериментів, зазначаючи, що LLM не створюють нових загроз, а тільки автоматизують вже існуючі методики.

Висновок

Дослідження Лермана та його команди підкреслює важливість використання LLM у контексті особистих даних і деанонімізації. Технології зростають у потужності, а отже, й ризики, пов’язані із зловживаннями, також можуть зростати. Це ставить на порядок денний нові етичні та правові питання, які потребують термінового обговорення в суспільстві.

Додати коментар