Колапс знань: дослідники назвали головний ризик ШІ
Колапс знань: дослідники назвали головний ризик ШІ

Колапс знань: дослідники назвали головний ризик ШІ

Штучний інтелект дедалі частіше стає для людей основним способом отримання інформації і може непомітно звужувати коло знань, до яких вони мають доступ, стверджують науковці. Про це повідомляє «Главком» з посиланням на TechRadar.

Дослідження провела міжнародна команда науковців, серед яких фахівці Університету Копенгагена та Університету Ольборга. Вони перевірили 27 великих мовних моделей за 155 темами, пов’язаними з 12 країнами. Для кожної теми використали 200 різних формулювань запитів, створених на основі реальних запитань користувачів.

Загалом отримали близько 1,7 млн відповідей, які розклали приблизно на 70 млн окремих тверджень. Розмаїття цих тверджень порівняли з інформацією, яку видає звичайний пошук Google.

Навіть GPT-5, який показав найкращий результат серед протестованих моделей, поступився Google: за даними авторів, пошукова система давала щонайменше на 18,7% різноманітнішу інформацію. Цей показник стосується широти охоплення, а не точності відповідей чи кількості помилок ШІ.

Водночас дослідження не доводить, що штучний інтелект уже призвів до втрати знань людством. Йдеться про потенційний ризик, який науковці називають «колапсом знань»: користувачі можуть дедалі частіше отримувати однаковий набір відповідей і рідше натрапляти на менш поширені погляди, факти та пояснення.

Як може виникнути «колапс знань»

Перший автор дослідження Дастін Райт пояснює, що мовні моделі не лише змінюють спосіб пошуку інформації, а й визначають, до яких відомостей користувачі взагалі отримують доступ. За його словами, люди можуть знову і знову бачити той самий набір тверджень.

Старша авторка роботи, професорка Університету Копенгагена Ізабель Ойґенштайн, попереджає: люди можуть отримувати менше різних поглядів, а їхні знання – стати вужчими. Тоді популярна інформація ставатиме ще помітнішою, а менш поширені матеріали поступово випадатимуть із поля зору.

Дослідники описують можливий замкнений цикл. Чим частіше люди звертатимуться до чатботів, тим більше бачитимуть лише ті твердження, які обирають моделі. Якщо згодом тексти, створені ШІ, потраплятимуть у нові навчальні масиви або використовуватимуться як джерела, системи можуть знову вчитися на вже звуженому наборі даних.

Автори наголошують, що наразі такого сценарію не зафіксовано.

Що впливає на розмаїття відповідей

Новіші покоління моделей загалом давали різноманітніші відповіді, ніж старіші версії, проте жодна з перевірених не досягла рівня звичайного інтернет-пошуку.

Окремо науковці перевірили технологію RAG (генерація відповіді із залученням даних із зовнішніх джерел) – підхід, за якого модель перед формуванням відповіді звертається до таких джерел. Ці відповіді виявилися різноманітнішими, ніж у моделей, які покладалися лише на власні дані, але й вони не зрівнялися з традиційним пошуком.

Ще одна особливість стосується локальних знань. Відповідаючи про конкретні країни, англомовні моделі частіше відтворювали інформацію та уявлення англомовного середовища, а не знання, доступні місцевими мовами. Дослідники вважають це проблемою для представлення культурних і регіональних особливостей.

Більший розмір моделі сам по собі не гарантував ширшого розмаїття: науковці виявили статистично значущий негативний зв’язок між цими показниками. Автори припускають, що великі моделі краще запам’ятовують поширені закономірності й частіше їх відтворюють, але це лише можливе пояснення, а не доведений механізм.

Що радять дослідники

Науковці не закликають відмовлятися від чатботів: ШІ корисний для швидкого отримання інформації, проте, коли потрібен ширший контекст, варто звертатися до різних джерел. Розробників мовних моделей вони просять враховувати розмаїття знань під час навчання та оцінювання систем. На їхню думку, майбутні моделі мають не лише давати точні й доречні відповіді, а й зберігати широту інформації, доступної людям.

Джерело матеріала
loader
loader