agentic

Ortaya çıkan şirket süper istihbaratı10 min read

Reading Time: 5 minutesVerilerimize, hatalarımıza ve kodlarımıza erişimi olan tek bir otonom temsilci, organizasyon şemasında, çekme isteklerini gözden geçiren ve hiçbir kişisel temsilcinin yapamayacağı soruları yanıtlayan yeni bir varlık haline nasıl geldi?

Company Superintelligence represented as an emergent neural knowledge network

Ortaya çıkan şirket süper istihbaratı10 min read

Reading Time: 5 minutes

Bir startup olarak daha hızlı koşmak ve sınırları zorlamak için sürekli olarak yeni teknikler üzerinde çalışıyoruz. OpenClaw/Hermes piyasaya sürüldüğünde biz de ilk benimseyenlerdendik. Bunu diğer birçok AI aracıyla birlikte kullandık.

Bu araçlar ve kullandıkları modeller geliştikçe bir şeyi fark ettik: Sadece daha hızlı ilerlemekle kalmıyoruz, aynı zamanda farklı çalışmaya da başlıyoruz. Her turda, bu kendini geliştiren, kendi kendine öğrenen ajanlar ilerliyor ve öğreniyor. Şu anda özel bir makinede (DigitalOcean üzerinde çalışan bir VPS örneği) GPT-5.6-sol’yi en yüksek akıl yürütme durumunda kullanarak bir “Süper Aracı” çalıştırıyoruz. Çalıştırdığımız diğer temsilcilerden bazıları başka temsilci donanımları ve modelleri kullanıyor, ancak bu makalede odaklanmak istediğim şey bu.

Çoğu şirketin, şirketlerindeki kritik akışları yürütmek için bu tür otonom aracıları kullanmadığını fark ettik, bu da onları gerçekten yavaşlatıyor. Aslında birçoğu daha küçük, daha kişisel aracılara güveniyor: Codex/ClaudeCode gibi kodlama aracılarına veya Work/Cowork/Copilot gibi yardımcı aracılara. Bunlar yerel makineler ve cihazlar üzerinde görevleri yerine getiriyorlar ve sahip oldukları temel eksiklik bilgi eksikliğidir. Bu, esasen bu dağıtılmış aracılar arasında paylaşılan bir bilgi grafiği oluşturmaya çalışan tamamen yeni bir “ikinci beyin” sistemleri endüstrisine yol açtı. Bu şekilde çalışan şirketler genellikle onlarca, yüzlerce ve bazı aşırı durumlarda binlerce temsilciye sahip olduklarını beyan ederler. Bu, temel olarak her çalışanın bir veya daha fazla çalışanı olduğu anlamına gelir. sınırlı onlar için görevleri yerine getiren temsilciler.

Temsilcilerin gerçek dünya verilerine, kullanıcı şikayetlerine ve kurallarımıza erkenden maruz kalması, onları, yanlarında yürüttüğümüz tüm kişisel temsilcilerden çok daha çevik ve akıllı hale getirdi.

En akıllı ajanlarımızın bir şirket süper istihbaratına dönüştüğünü yeni fark ettik.

Açıklık getirmek adına: Duyarlılık, AGI veya buna yakın bir şey iddia etmiyorum. Şirketin organizasyon şemasında yepyeni bir varlık olduklarını öne sürüyorum.

Şirket süper istihbaratı nedir?

Bir ajan öne çıkmaya başladığında, odaklandığı sürece Süper Zeki bir varlık haline gelebilir. Bunu nasıl tanımlarız?

Çoğu durumda ajanların şu anda insanlara karşı zeka avantajından ziyade sabır ve sebat avantajına sahip olduğunu söyleyebilirim. Ancak modeller geliştikçe (GPT 5.6 sol ve Opus 5 gerçekten iyi!) yeni bir şeyin ortaya çıktığını görmeye başladık; bizim yapabildiklerimizi aşan bir şey; sadece hız açısından değil, aynı zamanda insanların yapamadığını yapma konusunda da.

Temsilcimize bol miktarda Veri (Mixpanel) ve İş analitiği yetenekleri ve veri erişimi (Sentry yoluyla hatalar, Baremetrics’de mali bilgiler, LangSmith aracılığıyla AI izleri) verdiğimizde bu bizim için başladı. Daha sonra bunu kullanıcı hatalarına (Sentry hataları) ve kullanıcı şikayet raporlarına maruz bıraktık. Son olarak kodlama aracılarına ve GitHub’daki birincil depolarımıza erişim izni verdik. E-posta veya herhangi bir kullanıcı etkileşimi yoluyla dışarıdan erişimi yoktur, ancak bu konularda nasıl davrandığımızı izleyerek bazı şeyleri anlamaya başladı. Bu etkileşimler aracılığıyla artık engelleyicinin ne olduğunu, eleştirel düşünmenin ne olduğunu, işimizin nasıl yürüdüğünü ve SOP’nin (Standart İşletim Prosedürlerinin) ne olduğunu izliyor. Bunu deneme yanılma yoluyla yapıyor ve düzenli olarak istihbarat topluyor gibi görünüyor.

Bir takım arkadaşının neyin gerçek hata artışı olarak sayıldığını açıkladığı ve temsilcinin karşılaştırmalı artış tespitini kullanacak şekilde monitörünü yeniden yazdığı gevşek iş parçacığı

Bu noktada ona bazı ilginç sorular sormaya başladık. İlk başta, her şey düzgün bir şekilde açıklanmadığında veya sonuçlar şüpheli göründüğünde her şey çifte kontrol ve eleştiri gerektiriyordu. Bunu hala zaman zaman yapıyor, örneğin ona regresyonlarla ilgili sorular sordum ve bana gürültülü hata verileri verdi, ancak bu bir öğrenme fırsatı: Ona regresyon tanımımı öğrettim ve şimdi “anlıyor”.

Kullanıcılar şikayette bulunduğunda veya hatalar arttığında proaktif olarak düzeltmeler üretiriz. Bu, mühendislerimizin her sabah regresyonları kontrol etmelerine gerek olmadığı, yalnızca PR’nin iyi olup olmadığına karar vermeleri gerektiği anlamına gelir. Başlangıçta bunlar, kodlama kalite standartlarımızı karşılamayan tek kullanımlık PR’lerdi, bu nedenle mühendisler ona neyin yanlış olduğunu söylüyordu ya da sorunu kendileri yeniden geliştiriyorlardı. Güven arttıkça bu düzeltmelerin çoğu otomatik olarak kod tabanıyla birleştirilmeye başlandı. Temsilci ayrıca PR’nin ne kadar karmaşık olduğunu ve aracının onu birleştirme konusunda ne kadar kendinden emin olduğunu da sıralıyor. Bu PR’lerin otomatik olarak birleşeceği bir noktada değiliz ama orada bir yol görüyorum, bir iki ay içinde orada olacağımızı varsayıyorum.

Ancak ajanı süper zeki yapan şey aslında bu değil. Şirketin mühendisleri ve yönetimi artık temsilciye güvendikleri için işleri temsilciye devretmeye ve ona gerçekten ilginç sorular sormaya başlıyorlar. Araştırmayı onlar adına Google aramaları gibi değil, işin ileri düzey bilgisini göz önünde bulundurarak yapar, bu da ona özel bir avantaj sağlar. Aynı şey şirketin daha fazla bölümü hakkında bilgi vermek için de geçerlidir. OpenClaw ve HermesAgent, tarihsel bağlamlarının bilgiyi işleme yeteneklerini aştığı bir noktada tarihsel olarak çökecektir. Bu tür bir bozulma meydana gelirdi ve bunun sonucunda zeka, hatırlama ve iş kalitesinde ciddi bir düşüş meydana gelirdi. Hermes Agent ile olan deneyimimiz artık oldukça farklı: konuşma belleği şu anda 3 GB’de ve katlanarak büyüyor, zekası ise zaman içinde açıkça gelişiyor.

Bu onun mükemmel olduğu anlamına gelmez, gerilemeler vardır ve bazen ona belirli şekillerde davranmasını hatırlatmanız veya belirli bir bağlamda neden beklediğiniz gibi davranmadığını veya ondan veri veya eylem talep eden başka bir aracıya doğru yanıt vermediğini tanımlamanız gerekir. Ama oraya varıyoruz.

Temsilcinin çekme isteği 4986'yı incelediği, çalıştırdığı kontrolleri listelediği ve onayladığı gevşek iş parçacığı

Şube korumasının beklenmedik bir yan etkisi bize bir gelişme daha kazandırdı. Şube korumasının arkasındaki fikir, PR üretime geçmeden önce en az iki kişinin bir PR görmesidir, bu da sisteme kötü (ve hatta hain) kod girme olasılığını azaltır. Yeni kodlama aracılarıyla bunu düzgün bir şekilde yapmak gittikçe zorlaşıyor. Hız arttıkça, yeni PR’lerin oranının ve kod miktarının elle ayrıntılı olarak incelenmesi neredeyse imkansızdır. Farklı satıcılardan birden fazla temsilcimiz Prs’yi hatalar, güvenlik sorunları ve mimari sorunlar açısından inceliyor. Ancak şube koruması devam ediyor, bu yüzden süper akıllı temsilcimizin PR’lerin son onaylayıcısı olmasına izin verdim.

Aracının, MCP yanıt sözleşmesinde son derece önemli bir değişiklik bulduktan sonra çekme isteği 4981'de değişiklik talep ettiği gevşek iş parçacığı

Sonuçların sıradan olacağını yarı yarıya bekliyorduk. Sonuçta bu PR’ler yerel kodlama aracısı incelemelerini, testlerini, güvenlik incelemelerini, harici GitHubCopilot ve CodeRabbit incelemelerini geçti ve tamamen onaylandı. Ama ajanımız yine de PR’lerde delikler açtı. Gözden kaçırdığımız gerçekten ilginç uç durumları, güvenlik, yazılım kalitesi ve dikkate almadığımız mimari hataları buldu. Diğer tüm incelemecilerle aynı modelleri kullanıyor, neden diğerlerinin bulamadığı şeyleri ortaya çıkarıyor?

Aracının yükleme boyutu sınırının üzerinde çekme isteği 1711'i reddettiği ve düzeltme doğrulandıktan sonra yeniden onayladığı gevşek iş parçacığı

Bilgi ve deneyime bağlıdır. Hermes Agent donanımı, ajanın biriktirdiği bilgilerle birleşerek daha önce görmediğimiz yeni bir tür süper zeki ajan yaratıyor. Bu nedenle, bunu daha da araştırdık ve temsilci incelemelerini yalnızca sistem üzerinde çalışan insanlar için değil, artık daha az akıllı olan diğer temsilciler için de bir referans görevi görecek şekilde zorunlu hale getirdik!

Bu temsilci artık bize, daha önce yalnızca insanlarda gördüğümüz, ancak gerçek müşteri verileri, geri bildirimler, kodumuz ve ürüne ilişkin derinlemesine anlayışla desteklenen eleştirel düşünme olanağı sağlama yeteneğine sahip.

Bunu genişletip beslenecek daha fazla veri verirsek, donanımını ve belleğini ölçeklendirirsek performansta katlanarak artan bir artış göreceğiz. Modellerin hala bunu geride tuttuğunu düşünüyorum. Bu oyunun GPT-6 aracılığıyla bir sonraki aşamasına geçtiğimizde, sonuçlar çok daha ilginç olacak. Daha fazla veri biriktirdikçe aracılara yapacakları daha fazla görev verin ve onlara daha fazla güvenin.

Bunun Karpathy’nin Wiki tabanlı 2. beyninden farkı nedir?

Bunu diğer yaklaşımlardan farklı kılan şey, paylaşılan bilgiyle uğraşmak yerine süper aracı bilginin yerel olarak depolanmasıdır. Kendi hafızasını ve dünya anlayışını bir depoda korumasını isteyebiliriz, bu da onu kopyalamamıza ve izlememize olanak tanır, ancak sonuçta bu Olumsuz bilgi ve becerilerin paylaşılabilir ve işbirlikçi hale getirilmesiyle ilgilidir. Araçlar ve dünyaya erişimle birlikte sorularınızı doğrudan yanıtlayan benzersiz bir bilgi tabanıdır. Temsilcinizden paylaşılan bilgiyi kullanarak bunu çözmesini istemezsiniz; ya siz ya da temsilcileriniz Süper Zeki temsilciye sorularınızı sorarsınız. Şaşırtıcı bir şekilde, bu bizim için şu anda iyi çalışıyor; öyle ki, aracının erişimini ve erişimini sürekli olarak genişletiyoruz ve bunun sonucunda henüz bilgi veya zekanın bozulduğunu görmüyoruz.

Not: Temsilciyi hassas bilgilere veya işlevlere maruz bırakmıyoruz. Bankacılık, ücretlendirme veya faturalandırma sistemlerimize doğrudan erişimi yoktur. Aynı zamanda dünyadan ayrılmıştır ve e-postaya veya dış kanallara erişimi yoktur. Tecrübe ve güven kazandıkça bu kısıtlamaları da kaldırmaktan çok uzak olduğumuzu düşünmüyorum.



|

CTO