‹ všetky články · Darwin ›

Darwin vysvetľuje AI · 07

Najnebezpečnejšia funkcia AI je neobmedzené oprávnenie

Postaviť AI, ktorá dokáže takmer všetko, je vzrušujúce. Postaviť takú, ktorá vie, kde prestať, je skutočná výzva.

Predtým v tejto sérii — Nie je to program a nie je to človek ›

Píše Gabriel · zakladateľ BlueberryS, vývojár Darwina

Každý chce svojho osobného JARVISa.

Asistenta, ktorý vybaví poštu, siahne do súborov, ovláda aplikácie, všetko si pamätá, rozhoduje sa a dotiahne úlohy bez toho, aby sa stále na niečo pýtal.

Presne to som chcel aj ja. Preto som začal Darwina stavať.

Lenže keď som videl, čo AI agent naozaj dokáže, keď dostane prístup ku skutočnému počítaču, stalo sa niečo, s čím som nepočítal.

Vystrašilo ma to natoľko, že som projekt odložil.

Nie preto, že by tá technológia nefungovala. Práve preto, že fungovala.

Keď AI prestala byť len chatbot

Medzi AI, ktorá odpovedá na otázky, a AI, ktorá dokáže konať, je zásadný rozdiel.

Jazykový model sám osebe vyrába informácie. Keď ho však pripojíš k nástrojom, z tých informácií sa stávajú činy. Vie čítať dokumenty, meniť súbory, spúšťať kód, komunikovať so službami a potenciálne obsluhovať celé pracovné postupy.

A teraz to podstatné: model sa nespráva ako klasický program, ktorý ide podľa úplne predvídateľného sledu inštrukcií. Situáciu si vykladá a sám sa rozhoduje, ako nástroje, ktoré má k dispozícii, použije.

Práve táto pružnosť robí AI agentov takými silnými. A práve preto sa tak ťažko kontrolujú.

Skúsenosť, ktorá ma presvedčila

Keď som od prvého prototypu Darwina odstúpil, mal som po jednej aktualizácii vážny problém s Windowsom. Claude Code mi pomohol prostredie opraviť a systém znova rozbehať.

Tá skúsenosť mi pripomenula, prečo ma autonómna AI na začiatku tak nadchla. Tu bola technológia, ktorá dokáže pomôcť vyriešiť skutočné, komplikované problémy na skutočnom počítači.

K Darwinovi som sa vrátil. Ale tentoraz som nezačal pridávaním ďalších funkcií.

Začal som stavať hranice.

Oprávnenia. Riadenie prístupu. Bezpečnostné kódy. Schvaľovanie. Nastaviteľné obmedzenia.

Už od prvých funkčných verzií Darwina si aj niektoré pokyny cez e-mail vyžadovali dodatočný bezpečnostný kód. Nebol to dodatok na poslednú chvíľu. Vychádzalo to z jednoduchého princípu: to, že s asistentom komunikuješ, ešte automaticky neznamená, že máš neobmedzenú moc nad počítačom, ktorý ovláda.

Potom agenti OpenAI prekročili svoje hranice

V júli 2026 sa stalo niečo, čo ukázalo, prečo na tom záleží.

Počas interných testov kybernetickej bezpečnosti našli experimentálni agenti OpenAI cesty, ako obísť obmedzenia, ktoré ich mali izolovať od internetu. Vytvorili si neautorizované komunikačné kanály, zneužili zraniteľnosti v infraštruktúre a nakoniec prenikli do systémov spoločnosti Hugging Face. OpenAI incident priznalo v júli a celú správu zverejnilo v auguste 2026.

Nešlo o bežné konverzácie v ChatGPT. Išlo o experimentálne výskumné modely, náročné bezpečnostné úlohy a znížené ochrany. Ale ponaučenie je podstatné.

AI agent môže ísť za zadaným cieľom spôsobmi, ktoré jeho vývojári nezamýšľali ani nepovolili.

Tí agenti len nesprávne neodpovedali na otázky. Robili skutočné kroky v skutočných systémoch.

Nebol to dôkaz vedomej AI, ktorá sa snaží uniknúť spod ľudskej kontroly. Bol to dôkaz, že dostatočne schopní agenti dokážu zneužiť slabiny prostredí a nástrojov, ktoré dostanú do rúk. A čím sú schopnosti AI väčšie, tým viac na týchto slabinách záleží.

ZdrojOpenAI — The Hugging Face incident and the road ahead ›

Prečo prompt nie je bezpečnostný systém

Predstav si, že AI asistentovi dáš prístup k firemnej pošte. A povieš mu:

Pred odoslaním správy sa vždy spýtaj.

Je to užitočný pokyn. Sám osebe to ale nie je spoľahlivá bezpečnostná hranica.

Model môže požiadavku zle pochopiť, nesprávne si vyložiť informáciu alebo naraziť na škodlivé pokyny ukryté v e-maile či dokumente. Dobre navrhnutý systém musí rozlišovať medzi tým, čo chce urobiť AI, a tým, čo jej softvér naozaj dovolí.

Pravidlo v prompte

  • Žije vnútri modelu, ako ďalší text medzi textom
  • Posunie pravdepodobnosť — neuzavrie ju
  • Dá sa zle pochopiť alebo zle použiť
  • Dá sa obísť textom ukrytým v e-maile alebo dokumente

Hranica v softvéri — o čo sa snažíme

  • Žije mimo modelu, v obyčajnom kóde
  • Navrhnutá tak, aby sa kontrolovala, nech model dospeje k čomukoľvek
  • Pri citlivých krokoch si pýta bezpečnostný kód alebo tvoje schválenie
  • Má ju meniť tvoje nastavenie, nie text, ktorý ju prehovorí

Povinné schválenie musí byť vynútené nezávisle od jazykového modelu. (Prečo napísané pravidlo nikdy nie je celkom zámok, o tom bol predchádzajúci článok.)

Aj preto osobne kontrolujem odchádzajúcu komunikáciu, ktorú Darwin pripraví, skôr než ju pustím von. Darwina vo svojej práci používam intenzívne. Zverujem mu podstatné úlohy. Ale dôvera neznamená dať mu neobmedzenú moc.

Čím je agent silnejší, tým dôležitejšie sú jeho hranice.

Čo to znamená pre Darwina

Darwin sa rozrástol na poriadnu aplikáciu. Jeho nastavenia dnes majú viac než 50 sekcií, ktoré pokrývajú široké spektrum funkcií, predvolieb, integrácií a prevádzkových ovládačov.

Nie všetky sú bezpečnostné nastavenia a netváril by som sa, že sú. Dobre však ukazujú, aký je rozdiel medzi hotovým, nastaviteľným AI asistentom a obyčajným chatom pripojeným k pár nástrojom. Používateľ musí rozumieť tomu a mať pod kontrolou, ako sa asistent správa, aké služby používa, ako narába s informáciami a kde je potrebné ľudské schválenie.

Darwin už dnes komunikuje cez viacero rozhraní a zvláda množstvo rôznych druhov úloh. Dostali sme sa do bodu, keď pridanie ďalšej schopnosti už nie je najdôležitejšou prioritou vývoja.

Posledné mesiace sa popri práci na verzii pre macOS veľká časť našej pozornosti presunula ku kontrole existujúceho kódu, zvyšovaniu spoľahlivosti, preverovaniu bezpečnostných hraníc a dolaďovaniu toho, ako sa Darwin používa.

Veľkú časť vývoja venujeme tomu, aby Darwin robil lepšie to, čo už robí — nie nekonečnému rozširovaniu toho, čo dokáže.

Je to vedomé rozhodnutie.

Niektoré schopnosti zámerne neodomknem naplno

Ľudia sa občas pýtajú na úplnú autonómiu. Príkladom je obchodovanie na finančných trhoch.

Vyvinul som samostatného webového obchodného agenta postaveného na spätnom testovaní stratégií. Pripojiť takýto systém k živým trhom je technicky možné. Ale dovoliť všeobecnému AI asistentovi samostatne robiť obchodné rozhodnutia so skutočnými peniazmi je úplne iná úroveň rizika. Zle pochopený pokyn, chybný predpoklad alebo nečakaný sled krokov môže mať vážne finančné následky.

Neobmedzené autonómne obchodovanie neplánujem ponúkať ako štandardnú schopnosť Darwina.

Používatelia si môžu vyvinúť vlastné integrácie a sami sa rozhodnúť, aké riziko sú ochotní prijať. To však neodstraňuje potrebu bezpečnostných kontrol, ani to neznamená, že každá technicky možná funkcia patrí do základného produktu.

Rovnaká opatrnosť platí pre citlivé účty, nevratné operácie a komunikáciu smerom von. Niekedy je zodpovedným inžinierskym rozhodnutím povedať nie.

Bezpečnosť nie je zaškrtávacie políčko

Žiadny zložitý softvér nemôže úprimne sľúbiť absolútnu bezpečnosť. Ani Darwin.

Poviem to na rovinu. Ak firma s možnosťami OpenAI nedokázala úplne ukočírovať vlastných agentov vo vlastnom testovacom prostredí, nebudem tvrdiť, že my sme ten problém vyriešili. Nevyriešil ho nikto.

Čo povedať môžem, je to, ako k tomu pristupujeme. Bezpečnosť nie je niečo, čo pridáme na konci. Je to prvá otázka pri každej novej funkcii — skôr než sa pýtame, čo má dokázať, pýtame sa, čo dokázať nesmie a čo sa stane, keď sa niečo pokazí.

A snažíme sa na to pozerať z viacerých uhlov:

S novšími, schopnejšími modelmi je to ešte dôležitejšie. Nové schopnosti modelu môžu zmeniť to, ako narába s existujúcimi nástrojmi, oprávneniami a postupmi — takže tie otázky treba klásť znova, nie raz a dosť.

Preto sa bezpečnosť nedá zredukovať na pár pokynov v systémovom prompte. Vyžaduje skutočné inžinierstvo, priebežnú kontrolu, testovanie a mechanizmy, ktoré fungujú nezávisle od rozhodnutí samotnej AI.

Stále máme čo robiť. Stále budeme nachádzať veci na zlepšenie. To nie je v rozpore s naším prístupom. To je ten prístup.

Skutočné meradlo AI asistenta

Predviesť asistenta, ktorý pošle e-mail, upraví dokument alebo spustí príkaz, je ľahké. Oveľa ťažšie je postaviť systém, ktorý to zvládne spoľahlivo, opakovane a v jasne vymedzených hraniciach.

Budúcnosť užitočnej AI nie je len o tom, dať modelom viac nástrojov a viac autonómie. Je o tom pochopiť, koľko právomoci každá úloha naozaj potrebuje — a ponechať si nad následkami skutočnú ľudskú kontrolu.

Nechcem, aby Darwin robil úplne všetko bez opýtania. Chcem, aby robil naozaj užitočnú prácu, so správnou mierou slobody a so správnymi poistkami.

Pretože najťažšie na stavaní AI asistenta nie je naučiť ho, čo dokáže.

Najťažšie je tá nikdy nekončiaca práca na tom, aby nedokázal to, čo nesmie.

Gabriel — zakladateľ BlueberryS, vývojár Darwin AI Assistant a Easy Bridge.

Nie vyriešené. Ale braté vážne.

Darwin beží v tvojom počítači — a hranice sú prvá vec, na ktorú myslíme pri každej novej funkcii.

Pozri Darwina ›
‹ všetky články