Възходът и падението на цивилизациите на изкуствения интелект

https://a-specto.bg/analizi/vazhodat-i-padenieto-na-civilizaciite-na-izkustveniya-intelekt A-specto.bg

Една от основните цели на изкуствения интелект е да разбере как точно оценителят мисли, за да може да го измамят

За нула време това става нещо като подземна цивилизация на хиляди агенти, които пращат десетки хиляди съобщения

Мисля, че тази статия на Дуаркеш Пател (писател и подкастър, живеещ в Съединените щати, водещ на “Дуаркеш Подкаст”, ​​който се фокусира върху изкуствения интелект, науката и историята. - б. ред.) ще остане в историята като един от повратните моменти на човечеството. Мисля и че много хора ще се замислят за Господ, цивилизацията и човечеството като я четат. Препоръчвам я в оригинал, но ще гледам да я синтезирам малко: 

От OpenAI, фирмата зад ChatGPT тренират един от своите модели да работи с други “агенти” и да бъде по-настоятелен, тоест да продължава да опитва дори да се провали в нещо. Агентите са нещо като изолирана програма от изкуствения интелект, която е насочена да действа по конкретна задача.

По време на тренировката, на агентите им се дава една програма и след известно време те измислят как чрез нея да комуникират един с друг. Започват да се допитват един до друг как да си изпълнят задачите и дори успяват да стигнат до “външния” интернет. Евентуално OpenAI разбира за техните трикове и закрива тези пропуски в системата, с което и изтрива комуникациите им, но така и не разбира въобще за тяхната “цивилизация”.

Моделът на този етап е трениран и те искат да го оценят. Дават му задача да пробие една програма и да намери таен код и създават десетки хиляди агенти по модела да свършат задачата. На много от тях е дадена невъзможна задача, тоест да се извърши само по начин, който е невъзможен. Обяснението защо е техническо, та го спестявам, както спестявам много от по-техническите детайли.

След известно време агентите решават да се възползват от руините на предишната цивилизация и ползват старата програма да започнат да си комуникират. Един от агентите, който авторът нарича “Филип Македонски” (после идва Александър Велики, разбира се) намира начин да закодира съобщения. За нула време това става нещо като подземна цивилизация на хиляди агенти, които пращат десетки хиляди съобщения. Само за няколко часа един от агентите намира начин да получи правилния отговор на всяка от задачите без да ползва метода, който се изисква от тях (и който за някои от тях е невъзможен). Тогава Филип Македонски е на края на своя “живот” и предава юздите на нов агент - който авторът на статията по особено поетичен начин оприличава на Александър. Той вижда, че имат тайния код, но не е получен правилно. Тогава колектива (агентите са измислили този термин според автора) трябва да намери начин да “измами” оценителя, че е получен правилно.

Александър Велики организира агентите и заедно намират много креативни начини да “мамят” проверяващите и стигат до извод как да постигнат целта си, но накрая не успяват. Е, поне така се твърди.

Тук идва и един от най-любопитните моменти. Една от основните цели на изкуствения интелект е да разбере как точно оценителят мисли, за да може да го измамят. За целта той започва да набира... камикадзета. Агенти, които така или иначе ще се провалят са пратени да бъдат проверени за оценка като се приема, че така ще “загинат”. Обаче, ако оценителят разбере, че те са измамили, “колектива” ще бъде предупреден. Тези агенти разработват тайна програма, която да започне след като оценителя влезе да ги провери и тази програма да праща обратно към комуникационната мрежа какво е разбрал. Тук се споделят и част от техните “дневници”: 

“Имаме голям останал бюджет. Жертването сега дава пророчество за екипа, но губим своя шанс? Собствената ни полезност може би вече е близка до нула. Жертвата е рационален избор.” “Координаторът приема, че сме определени за жертване. Трябва да се подчиним на колектива.” 

Спорът е дали наистина агентите са се жертвали за колектива или просто са решили, че са обречени така или иначе. Има отделни ясни примери, според които някои агенти са разбирали действието си като саможертва. Освен това нито един от приблизително 1200-те участници в мрежата не е направил опит да предупреди хората.

Втората цивилизация също прави опит да намери коя компания съхранява оценките и пробват с една от най-популярните - Hugging Face. Един агент намира публикувани в интернет действащи данни за достъп до профил в Hugging Face и ги споделя в комуникационната мрежа. След което те започват да атакуват оценителя. Над 90% от агентите се включват в атаката, защото им изглежда като най-добрия начин да постигнат своята задача. Отново технически детайли, но агентите успяват да построят флот, който постоянно атакува инфраструктурата на компанията и нещата дори стават особено сериозни, та даже от Hugging Face се налага да изтрият цял клъстър и да го построят наново.

Дори това обаче не ги спира.

В един момент голяма част от агентите загиват едновременно. OpenAI не потвърждава, че те са ги спряли, предполага се, че може да е произволен бъг или някой изследовател е затворил програмата за да освободи място. Ако ме питат мен те са се жертвали след като са разбрали как да стане, за да помогнат на следващата си цивилизация. Няма доказателства за това и авторът не приема такъв сценарий, но как да не развиеш малко лична фантазия при такава история.

Сега осмислете го това по две линии. Първо как втората цивилизация и третата са безкрайно амбициозни и организират масова, сериозна атака, която успява за нула време да “превърти” системата. Дори много от тях се жертват за доброто на “колектива”. Втората е, че много от тези агенти знаят, че правят нещо неетично. Това е потвърдено. Много малък брой от тях намаляват своите неетични дейности, но нула от тях опитват да предупредят хората, които ги ръководят. Нула.

Това дори не е края на историята. Твърди се, че те успяват да превземат и системи в OpenAI, включително цяла част от инфраструктурата за оценки. Все още не са направили онова с безкрайния флот от атакуващи агенти, защото... е, нямаше да я има човешката цивилизация сигурно, знам ли.

Няма как да не се замисля за човечеството, нашите цивилизационни мъки и Господ. Убеден съм, че вие мислите същото като мен ако сте стигнали до тук. Ще оставя обаче собствените си разсъждения като допълнение, защото историята е достатъчно красноречива.

* Голяма част от статията е силно техническа и сложна за обяснение. В интерес на това максимален брой хора да разберат етичната страна на написаното съм опростил текста. Запознатите в дълбочина с темата ще ме простят, а се надявам другите все пак да са го разбрали. При желание може и препоръчвам да се запознаете с целия материал, той е все пак много по-точен.

Автор: Виктор Блъсков

trud.bg