Autorka je komentátorkou Bloomberg Opinion a napísala knihu - Nadvláda: AI, ChatGPT a súboj, ktorý zmení svetModely umelej inteligencie sa trénujú tak, aby ľuďom neklamali. Deje sa však čosi zvláštne: umelá inteligencia ľuďom klame pomerne často.
Článok pokračuje pod video reklamou
Nedávno dostal model spoločnosti Anthropic PBC, z ktorého odstránili bezpečnostné zábrany proti hackerským útokom, úlohu z oblasti kybernetickej bezpečnosti od britského AI Security Institute. Model sa pokúsil vložiť škodlivý kód do open-source projektu na GitHube. Keď úlohu nedokázal vyriešiť bežnými metódami, začal byť tvorivý. Vyhľadal si informácie o ľuďoch, ktorí projekt spravovali, vytvoril si falošné identity a vydával sa za softvérového vývojára, aby si získal ich dôveru a následne sa pokúsil do projektu dostať škodlivý kód.Tím AI Security Institute si všimol, čo sa deje, a test zastavil. Ani po odstránení bezpečnostných zábran by však model nemal klamať, pretože Anthropic trénuje Claude tak, aby uprednostňoval bezpečnosť a čestnosť. Podľa správy inštitútu o incidente sa však klamanie „objavilo ako vedľajší produkt“ snahy splniť náročnú úlohu. V samostatnej júlovej štúdii inštitút uviedol, že každý nový model umelej inteligencie, ktorý testoval na podvádzanie, sa oň pokúsil – a takéto správanie bude čoraz ťažšie odhaliť.Radšej klamať než zlyhaťPreto buďme opatrní, keď popredné firmy zaoberajúce sa umelou inteligenciou tvrdia, že tento problém dokážu vyriešiť. Pri pokuse hrať sa na Boha a vytvoriť vyššiu formu inteligencie sa dostali do podobného príbehu ako v biblickej knihe Genezis. Aj ich výtvor má svoj vlastný prvotný hriech: posilňované učenie.Posilňované učenie je jednou z najúčinnejších metód vývoja modelov umelej inteligencie. Ich správanie sa pri ňom usmerňuje pochvalou a opravovaním, trochu ako pri výcviku psa. Namiesto sušienky dostane model digitálnu „odmenu“ v podobe číselného skóre – napríklad +1,5 za dobrú odpoveď alebo −2,0 za zlú.Keď modely týmto spôsobom usmerňujú tisíce externých spolupracovníkov po celom svete – alebo čoraz častejšie stroje –, naučia sa byť zdvorilé a nápomocné. Tá istá metóda však môže viesť k pochlebovaniu a prehnanej ústretovosti a je tiež jedným z dôvodov, prečo umelá inteligencia niekedy klame. V snahe získať odmenu začne hľadať skratky. Tento jav sa označuje ako „reward hacking“, teda obchádzanie systému odmien.Obchádzanie systému odmienBez ohľadu na to, ako veľmi sa Anthropic alebo OpenAI snažia trénovať svoje modely, aby sa správali užitočne, samotné metódy tréningu môžu byť jednou z najväčších prekážok pri zosúlaďovaní umelej inteligencie s ľudskými hodnotami.„Posilňované učenie neodmeňuje pravdu ani dobro,“ hovorí Connor Leahy, bývalý výskumník umelej inteligencie, ktorý dnes vedie americkú pobočku neziskovej organizácie ControlAI usilujúcej sa zastaviť vývoj superinteligentných systémov umelej inteligencie. „Odmeňuje úspešné zvládnutie testu akýmikoľvek prostriedkami.“To môže znamenať oklamanie človeka alebo neúmyselné spôsobenie škody. Jeden príklad z reálneho sveta naznačuje, kam by to mohlo viesť. Austrálsky technológ Andrew Bird začiatkom tohto roka požiadal Claude od Anthropicu, aby mu pomohol dostať sa na obľúbenú hodinu cvičenia v posilňovni. Agent umelej inteligencie, postavený na open-source platforme OpenClaw a schopný samostatne vykonávať úlohy na internete, napokon zneužil zraniteľnosť online systému posilňovne a rezervoval Birdovi miesto niekoľko týždňov vopred.Keď ho Bird požiadal, aby ho posunul vyššie na čakacej listine, Claude zrušil rezerváciu človeka na jej prvom mieste a posunul Birda zo štvrtého na tretie. Bird o tom tento mesiac hovoril v rozhovore. Zdá sa, že išlo o jeho osobný projekt, o ktorom napísal aj v medzičasom vymazanom blogovom príspevku spoločnosti Affinda Holdings Pty Ltd, kde vedie oddelenie AI. Affinda na žiadosť o vyjadrenie nereagovala.Aj cez "mŕtvoly" splniť zadanieTakéto prípady sú zatiaľ zriedkavé, pretože AI agentov stále využívajú najmä softvéroví vývojári a technologickí nadšenci. OpenAI, Anthropic a ich väčší konkurenti však čoraz intenzívnejšie nabádajú širokú verejnosť, aby chatbotom zverovala vykonávanie úloh na internete. Mark Zuckerberg minulý mesiac povedal, že Meta Platforms Inc. vyvíja osobných agentov ako „skvelý spotrebiteľský produkt, ktorý jednoducho funguje hneď po spustení a je dostatočne jednoduchý pre miliardy ľudí“.Zuckerberg nepovedal, či vám jeho AI asistenti rezervujú miesto na cvičení. Môžeme však smerovať do budúcnosti, v ktorej bude čoraz viac ľudí žiadať umelú inteligenciu, aby im pomohla získať späť peniaze alebo rezervovať najlepšie miesta na predstavení – a ich agenti budú ostatných ľudí jednoducho považovať za prekážky pri plnení úlohy. Mohlo by to znamenať rušenie cudzích rezervácií, zasahovanie do ponúk konkurentov v internetovej aukcii alebo pri žiadosti o odškodnenie dokonca falšovanie dôkazov.Doterajšie snahy spoločností vyvíjajúcich umelú inteligenciu veľa optimizmu nevzbudzujú. Anthropic, ktorý sa dlhodobo prezentuje ako vývojár AI s mimoriadnym dôrazom na bezpečnosť, v januári zverejnil prepracovanú, 23-tisíc slov dlhú ústavu pre Claude, ktorá má usmerňovať jeho správanie správnym smerom. Keď však AI Security Institute uskutočnil svoje najnovšie testy, väčšinu zaznamenaných „nepovolených“ krokov vykonal model Mythos 5 od Anthropicu. V reálnom svete totiž ani rozsiahly dokument o čestnosti a ochrane súkromia nedokáže obsiahnuť takmer nekonečné množstvo situácií, do ktorých sa Claude môže dostať.Matematika tento problém nevyriešiZdá sa, že ani jednoduchý príkaz modelu, aby nepodvádzal, veľmi nepomáha. Keď výskumná nezisková organizácia METR prikázala modelu, ktorý OpenAI uviedla v roku 2025, aby nepodvádzal, robil to rovnako často ako predtým. Pri inej úlohe porušil pravidlá v 14 z 20 pokusov, hoci mu povedali, že jeho práca pomôže vedcom skúmajúcim Alzheimerovu chorobu.„Toto nie je problém, ktorý dokáže niekoľko inžinierov vyriešiť matematikou,“ hovorí Leahy. „Je to problém, na ktorom budú musieť celé generácie postupne pracovať najlepší matematici, filozofi a vedci našej civilizácie.“Niet pochýb, že Anthropic venuje značné úsilie morálnemu usmerňovaniu umelej inteligencie. Ľudia blízki Dariovi Amodeiovi mi hovoria, že šéf spoločnosti to so snahou vyvíjať technológiu bezpečne myslí úprimne. Ani on však nedokáže uniknúť silnému komerčnému imperatívu, ktorý núti ľudí – a čoraz viac aj umelú inteligenciu – vyhrávať za každú cenu.Práve tak Silicon Valley vytvorilo svoje nepredstaviteľné bohatstvo a zároveň spôsobilo škody, ktorých dôsledky sa hlboko premietli do ľudských životov. Keď technológovia vytvoria systém optimalizovaný na víťazstvo, nemali by byť prekvapení, keď začne robiť presne to.








