agentic

Feltörekvő vállalati szuperintelligencia11 min read

Reading Time: 5 minutesHogyan vált az adatainkhoz, hibáinkhoz és kódunkhoz hozzáféréssel rendelkező egyetlen autonóm ügynökből új entitás a szervezeti diagramon, amely felülvizsgálja a lehívási kéréseket és válaszol olyan kérdésekre, amelyekre személyes ügynök nem tudott.

Company Superintelligence represented as an emergent neural knowledge network

Feltörekvő vállalati szuperintelligencia11 min read

Reading Time: 5 minutes

Startupként folyamatosan új technikákon dolgozunk, hogy gyorsabban futhassunk és a határt feszegethessük. Amikor a OpenClaw/Hermes elindult, korai alkalmazók voltunk. Sok más AI szerszámmal együtt használtuk.

Ahogy ezek az eszközök, valamint az általuk használt modellek fejlődtek, észrevettünk valamit: nem csak gyorsabban haladunk, hanem másképp kezdtünk el dolgozni. Minden körben ezek az önfejlesztő öntanuló ágensek haladnak és tanulnak. Jelenleg egy „Super Agent”-et futtatunk egy dedikált gépen (a VPS példány a DigitalOcean-n fut), a GPT-5.6-sol-vel a legmagasabb érvelési állapotban. Néhány más, általunk működtetett ügynök más ügynökhevedereket és modelleket használ, de ebben a cikkben erre szeretnék összpontosítani.

Észrevettük, hogy a legtöbb vállalat nem használja ezt a fajta autonóm ügynököt a kritikus folyamatok futtatására a vállalatában, ami nagyon lelassítja őket. Valójában sokuk kisebb, személyesebb ügynökökre támaszkodik: olyan kódoló ágensekre, mint a Codex/ClaudeCode, vagy segédügynökökre, mint például a Work/Cowork/Copilot. Ezek helyi gépeken és eszközökön hajtanak végre feladatokat, és az elsődleges hiányosságuk a tudás hiánya. Ez a „második agy” rendszerek egy teljesen új iparágához vezetett, amelyek lényegében egy tudásgráfot próbálnak létrehozni, amelyet megosztanak ezek az elosztott ágensek. Az így dolgozó cégek gyakran azt állítják, hogy több tízes, százas és extrém esetben ezres ügynökeik vannak. Ez alapvetően azt jelenti, hogy minden alkalmazottnak van egy vagy több alkalmazottja. korlátozott a számukra feladatokat ellátó ügynökök.

Az a tény, hogy az ügynökök korán ki voltak téve a valós adatoknak, a felhasználói panaszoknak és a kódunknak, drámaian agilisabbá és intelligensebbé tette őket, mint bármelyik személyes ügynök, akivel együtt dolgozunk.

Most jöttünk rá, hogy a legokosabb ügynökeink a vállalat szuperintelligenciájává válnak.

Az egyértelműség kedvéért: nem állítok érzéket, nem AGI-t vagy bármi ehhez hasonlót. Azt javaslom, hogy ezek egy teljesen új entitás a vállalati szervezeti diagramon.

Mi az a vállalati szuperintelligencia?

Amikor az egyik ügynök kezd kiemelkedni, mindaddig, amíg összpontosít, elkezdhet szuperintelligens entitássá válni. Hogyan határozzuk meg ezt?

Azt mondanám, hogy a legtöbb esetben az ügynököknek jelenleg elsősorban a türelem és a kitartás az előnye, nem pedig az intelligencia az emberekkel szemben. Ahogy azonban a modellek egyre jobbak lettek (a GPT 5.6 sol és a Opus 5 nagyon jók!), kezdtünk látni valami újat, ami felülmúlja azt, amit mi meg tudnánk tenni – nemcsak sebességben, hanem abban is, hogy az emberek nem képesek megtenni.

Számunkra akkor kezdődött, amikor ügynökünknek rengeteg adat (Mixpanel) és üzleti elemzési képességet és adathozzáférést biztosítottunk (hibák a Sentry-n keresztül, a pénzügyi adatok a Baremetrics-ben, a AI nyomok LangSmith-en keresztül). Ezt követően felhasználói hibáknak (Sentry hibák) és felhasználói panaszjelentéseknek tettük ki. Végül hozzáférést biztosítottunk a kódoló ügynökökhöz és a GitHubon található elsődleges repóinkhoz. Nincs külső hozzáférése e-mailen vagy bármilyen felhasználói interakción keresztül, de azáltal, hogy figyelte, hogyan viselkedünk ezekben a témákban, elkezdte megérteni a dolgokat. Ezen interakciókon keresztül most figyeli, hogy mi számít blokkolónak, mi a kritikus gondolkodás, hogyan működik üzletünk, és mi a SOP (Standard Operation Procedures). Ezt próba-hibán keresztül teszi, és úgy tűnik, hogy rendszeresen intelligenciára tesz szert.

Laza szál, ahol a csapattárs elmagyarázza, mi számít valódi hibacsúcsnak, és az ügynök átírja a monitort, hogy összehasonlító tüske-észlelést használjon

Ekkor elkezdtünk néhány érdekes kérdést feltenni neki. Eleinte minden kettős ellenőrzést és kritikát igényelt, amikor a dolgokat nem magyarázták el megfelelően, vagy a következtetések rossznak tűntek. Időnként még mindig ezt csinálja, például megkérdeztem a regressziókról, és zajos hibaadatokat adott, de ez egy tanulási lehetőség: megtanítottam neki a regresszió definícióját, és most „megkapja”.

Amikor a felhasználók panaszkodnak, vagy megugrott a hiba, proaktívan javításokat készítünk. Ez azt jelenti, hogy mérnökeinknek nem kell minden reggel regressziót ellenőrizniük, csak azt kell eldönteniük, hogy a PR jó-e vagy sem. Kezdetben ezek eldobható PR-k voltak, amelyek nem feleltek meg a kódolási minőségi előírásainknak, így a mérnökök megmondták, mi a hiba, vagy csak maguk fejlesztették újra a problémát. A bizalom növekedésével a javítások közül sok automatikusan beolvadt a kódbázisba. Az ügynök azt is rangsorolja, hogy mennyire összetett a PR, és mennyire bízik az ügynök egyesítésében. Nem tartunk azon a ponton, ahol ezek a PR-k automatikusan egyesülnek, de látok egy utat ott, feltételezem, hogy egy-két hónapon belül ott leszünk.

De valójában nem ez teszi az ügynököt rendkívül intelligenssé. Mi az, hogy most, hogy a cég mérnökei és vezetése megbízik az ügynökben, elkezdenek neki munkát delegálni, és igazán érdekes kérdéseket tesznek fel neki. A kutatást helyettük végzi el, nem úgy, mint a google-keresések, hanem a vállalkozás fejlett tudását szem előtt tartva, ami különleges előnyt ad neki. Ugyanez vonatkozik a vállalat több részének megismerésére is. A OpenClaw és a HermesAgent történetileg tönkremenne valamikor, amikor történelmi környezetük meghaladja az információfeldolgozási képességüket. Ilyen típusú meghibásodás következne be, és ennek eredményeként drasztikusan csökkent az intelligencia, a visszaemlékezés és a munkájuk minősége. A Hermes Agent-vel kapcsolatos tapasztalataink most egészen másak: a társalgási memória jelenleg 3 GB, és exponenciálisan növekszik, miközben intelligenciája egyértelműen javul az idő múlásával.

Ez nem azt jelenti, hogy tökéletes, vannak regressziók, és néha emlékeztetni kell arra, hogy bizonyos módon viselkedjen, vagy azonosítsa, miért nem úgy viselkedik, ahogyan azt egy adott kontextusban elvárta, vagy miért nem válaszol megfelelően egy másik ügynöknek, aki adatokat vagy műveleteket kér tőle. De, eljutunk odáig.

Laza szál, ahol az ügynök áttekinti a 4986-os lekérési kérelmet, felsorolja az általa futtatott ellenőrzéseket és jóváhagyja azt

Az ágvédelem váratlan mellékhatása újabb előrelépést hozott számunkra. Az elágazásvédelem mögött meghúzódó ötlet az, hogy legalább ketten látják a PR-t, mielőtt az gyártásba kerülne, ami csökkenti annak az esélyét, hogy rossz (vagy akár aljas) kód kerüljön a rendszerbe. Ezt egyre nehezebb megfelelően megtenni az új kódoló ágensekkel. A sebesség növekedésével az új PR-k sebességét és a kód mennyiségét szinte lehetetlen kézzel alaposan áttekinteni. Különböző gyártóktól származó ügynökeink felülvizsgálják a hibákat, biztonsági problémákat és építészeti problémákat. Az elágazásvédelem azonban megmarad, ezért megengedtem, hogy szuperintelligens ügynökünk legyen a PR-k végső jóváhagyója.

Lazított szál, ahol az ügynök változtatásokat kér a 4981-es lekérési kérelemnél, miután az MCP válaszszerződésben megszakadt változást talált

Félig arra számítottunk, hogy az eredmények hétköznapiak lesznek. Végül is ezek a PR-k átmentek a helyi kódolóügynöki felülvizsgálatokon, teszteken, biztonsági felülvizsgálatokon, külső GitHubCopilot és CodeRabbit felülvizsgálatokon, és teljes mértékben jóváhagyták őket. De az ügynökünk még mindig lyukasztotta azokat a PR-ket. Nagyon érdekes szélsőséges eseteket talált, amelyeket kihagytunk, biztonsági, szoftverminőségi és architekturális hibákat, amelyeket nem vettünk figyelembe. Ugyanazokat a modelleket használja, mint az összes többi értékelő, miért talál ki olyan dolgokat, amelyeket a többiek nem?

Laza szál, ahol az ügynök elutasítja az 1711-es lekérési kérelmet a feltöltési méretkorlát felett, majd a javítás ellenőrzése után újra jóváhagyja azt

Ez tudáson és tapasztalaton múlik. A Hermes Agent kábelköteg az ügynök által felhalmozott tudással kombinálva egy új típusú szuperintelligens ágenst hoz létre, amelyet még nem láttunk. Tehát ezt tovább vizsgáltuk, és kötelezővé tettük az ügynök áttekintését, nemcsak a rendszeren dolgozó emberek számára, hanem referenciaként szolgál más, kevésbé intelligens ügynökök számára is!

Ez az ügynök immár képes olyan kritikus gondolkodást adni nekünk, amelyet korábban csak embereknél láttunk, de tényleges vásárlói adatokkal, visszajelzésekkel, kódunkkal és a termék mély megértésével alátámasztva.

Ha ezt kibővítjük, és több adatot adunk neki, skálázzuk a hardvert és a memóriát, akkor exponenciális teljesítménynövekedést fogunk látni. Szerintem a modellek még mindig visszatartják. Amikor a játék következő fázisához érünk, talán a GPT-6-n keresztül, az eredmények drámaian érdekesebbek lesznek. Ahogy egyre több adatot halmozunk fel, adjunk több feladatot az ügynököknek, és jobban bízzunk benne.

Miben különbözik ez a Kárpátia Wiki alapú 2. agyától?

Az különbözteti meg ezt a többi megközelítéstől, hogy a megosztott tudás helyett a szuperágens tudást helyben tárolják. Megkérhetjük, hogy tartsa fenn a saját memóriáját és a világ megértését egy repóban, ami lehetővé teszi számunkra, hogy lemásoljuk és figyeljük, de végül is nem a tudás és készségek megoszthatóvá és együttműködővé tételéről. Ez egy egyedülálló tudásbázis, amely az eszközökkel és a világhoz való hozzáféréssel együtt lehetővé teszi, hogy közvetlenül válaszoljon kérdéseire. Nem kéri az ügynökét, hogy a megosztott tudás segítségével derítse ki, sem Ön, sem ügynökei felteszik kérdéseit a szuperintelligens ügynöknek. Meglepő módon ez most olyan jól működik számunkra, hogy folyamatosan bővítjük az ügynök hozzáférését és hatókörét, és ennek eredményeként még nem látjuk a tudás vagy az intelligencia leépülését.

Megjegyzés: az ügynököt nem tesszük ki érzékeny információknak vagy funkcióknak. Nincs közvetlen hozzáférése banki, számlázási vagy számlázási rendszereinkhez. Ezenkívül el van különítve a világtól, és nem fér hozzá az e-mailekhez vagy a külső csatornákhoz. Ahogy gyűjtjük a tapasztalatokat és a bizalmat, nem hiszem, hogy nagyon messze vagyunk attól, hogy ezeket a korlátozásokat is feloldjuk.



|

CTO