agentic

उभरती कंपनी अधीक्षण2 min read

Reading Time: 7 minutesकैसे हमारे डेटा, त्रुटियों और कोड तक पहुंच वाला एक स्वायत्त एजेंट ऑर्ग चार्ट पर एक नई इकाई बन गया, जो पुल अनुरोधों की समीक्षा करता है और उन सवालों का जवाब देता है जो कोई व्यक्तिगत एजेंट नहीं कर सकता।

  • अगस्त 13, 2026 7 min read
Company Superintelligence represented as an emergent neural knowledge network

उभरती कंपनी अधीक्षण2 min read

Reading Time: 7 minutes

एक स्टार्टअप के रूप में, हम तेजी से चलने और सीमाओं को आगे बढ़ाने के लिए लगातार नई तकनीकों पर काम कर रहे हैं। जब OpenClaw/Hermes लॉन्च हुआ, तो हम शुरुआती अपनाने वाले थे। हमने इसे कई अन्य AI टूल के साथ उपयोग किया।

जैसे-जैसे ये उपकरण, साथ ही जिन मॉडलों पर वे भरोसा करते हैं, वे उन्नत हुए, हमने कुछ देखा: हम न केवल तेजी से प्रगति कर रहे हैं, हमने अलग तरीके से काम करना शुरू कर दिया है। प्रत्येक दौर के साथ, ये स्वयं सुधार करने वाले स्वयं सीखने वाले एजेंट आगे बढ़ रहे हैं और सीख रहे हैं। वर्तमान में हम उच्चतम तर्क स्थिति में GPT-5.6-sol का उपयोग करके एक समर्पित मशीन (VPS पर चलने वाला एक VPS उदाहरण) पर एक “सुपर एजेंट” चला रहे हैं। हमारे द्वारा चलाए जा रहे कुछ अन्य एजेंट अन्य एजेंट हार्नेस और मॉडल का उपयोग करते हैं, लेकिन यह वह है जिस पर मैं इस लेख में ध्यान केंद्रित करना चाहता हूं।

हमने देखा कि अधिकांश कंपनियाँ अपनी कंपनी में महत्वपूर्ण प्रवाह चलाने के लिए इस प्रकार के स्वायत्त एजेंट का उपयोग नहीं कर रही हैं, जो वास्तव में उन्हें धीमा कर देता है। वास्तव में, उनमें से कई छोटे, अधिक व्यक्तिगत एजेंटों पर भरोसा करते हैं: कोडिंग एजेंट जैसे Codex/ClaudeCode या सहायक एजेंट जैसे Work/Cowork/Copilot। ये स्थानीय मशीनों और उपकरणों पर कार्य करते हैं और उनमें मुख्य कमी ज्ञान की कमी है। इससे “दूसरे मस्तिष्क” प्रणालियों का एक नया उद्योग सामने आया जो अनिवार्य रूप से एक ज्ञान ग्राफ बनाने की कोशिश करता है जो इन वितरित एजेंटों के बीच साझा किया जाता है। इस तरह से काम करने वाली कंपनियां अक्सर घोषणा करती हैं कि उनके पास दसियों, सैकड़ों और कुछ चरम मामलों में हजारों की संख्या में एजेंट हैं। इसका मूल रूप से मतलब है कि प्रत्येक कर्मचारी के पास एक या अधिक हैं सीमित एजेंट उनके लिए कार्य कर रहे हैं।

तथ्य यह है कि एजेंट वास्तविक दुनिया के डेटा, उपयोगकर्ता शिकायतों और हमारे कोड के संपर्क में जल्दी आ गए थे, जिससे वे हमारे साथ चल रहे किसी भी व्यक्तिगत एजेंट की तुलना में नाटकीय रूप से अधिक चुस्त और स्मार्ट बन गए।

हमें अभी एहसास हुआ कि हमारे सबसे चतुर एजेंट कंपनी के सुपरइंटेलिजेंस बन रहे हैं।

स्पष्टता के लिए: मैं भावना, AGI या उसके करीब किसी चीज़ का दावा नहीं कर रहा हूँ। मैं प्रस्ताव कर रहा हूं कि वे कंपनी ऑर्ग चार्ट में एक बिल्कुल नई इकाई हैं।

कंपनी अधीक्षण क्या है?

जब एक एजेंट अलग दिखना शुरू करता है, जब तक वह केंद्रित रहता है, वह एक सुपरइंटेलिजेंट इकाई बनना शुरू कर सकता है। हम इसे कैसे परिभाषित करें?

मैं कहूंगा कि ज्यादातर मामलों में, एजेंटों को अभी मुख्य रूप से धैर्य और दृढ़ता का फायदा है, न कि इंसानों की तुलना में बुद्धिमत्ता का। हालाँकि, जैसे-जैसे मॉडल बेहतर होते गए (GPT 5.6 sol और Opus 5 वास्तव में अच्छे हैं!) हमने कुछ नया उभरते हुए देखना शुरू कर दिया है, कुछ ऐसा जो हम जो कर सकते हैं उससे कहीं आगे है – न केवल गति में बल्कि वह काम करने में जो मनुष्य नहीं कर सकते।

यह हमारे लिए तब शुरू हुआ जब हमने अपने एजेंट को प्रचुर मात्रा में डेटा (Mixpanel) और बिजनेस एनालिटिक्स क्षमताएं और डेटा एक्सेस (Sentry के माध्यम से त्रुटियां, Baremetrics में वित्तीय, लैंगस्मिथ के माध्यम से AI ट्रेस) दिया। इसके बाद, हमने इसे उपयोगकर्ता बग (Sentry त्रुटियां) और उपयोगकर्ता शिकायत रिपोर्टों से अवगत कराया। अंत में, हमने इसे जीथब पर कोडिंग एजेंटों और हमारे प्राथमिक रिपोज तक पहुंच प्रदान की। ईमेल, या किसी उपयोगकर्ता इंटरैक्शन के माध्यम से इसकी कोई बाहरी पहुंच नहीं है, लेकिन यह देखने के माध्यम से कि हम इन विषयों पर कैसे व्यवहार करते हैं, इसने चीजों को समझना शुरू कर दिया। इन इंटरैक्शन के माध्यम से अब यह निगरानी करता है कि अवरोधक क्या है, आलोचनात्मक सोच क्या है, हमारा व्यवसाय कैसे चलता है और SOP (मानक संचालन प्रक्रियाएं) क्या हैं। यह परीक्षण और त्रुटि के माध्यम से ऐसा करता है और ऐसा लगता है कि यह नियमित आधार पर बुद्धिमत्ता प्राप्त कर रहा है।

स्लैक थ्रेड जहां एक टीम का साथी बताता है कि वास्तविक त्रुटि स्पाइक के रूप में क्या गिना जाता है और एजेंट तुलनात्मक स्पाइक डिटेक्शन का उपयोग करने के लिए अपने मॉनिटर को फिर से लिखता है

उस समय, हमने उससे कुछ दिलचस्प प्रश्न पूछना शुरू किया। सबसे पहले, जब चीज़ों को ठीक से समझाया नहीं गया था या निष्कर्ष गड़बड़ लग रहे थे, तो हर चीज़ की दोबारा जाँच और आलोचना की आवश्यकता थी। यह अभी भी समय-समय पर ऐसा करता है, उदाहरण के लिए मैंने इससे प्रतिगमन के बारे में पूछा और इसने मुझे शोर वाला त्रुटि डेटा दिया, लेकिन यह सीखने का अवसर है: मैंने इसे प्रतिगमन की अपनी परिभाषा सिखाई और अब यह “समझ गया”।

जब उपयोगकर्ता शिकायत करते हैं या त्रुटियाँ बढ़ती हैं, तो हम सक्रिय रूप से समाधान तैयार करते हैं। इसका मतलब है कि हर सुबह, हमारे इंजीनियरों को प्रतिगमन की जांच करने की ज़रूरत नहीं है, उन्हें बस यह तय करने की ज़रूरत है कि PR अच्छा है या नहीं। शुरुआत में, ये डिस्पोजेबल PR थे जो हमारे कोडिंग गुणवत्ता मानकों को पूरा नहीं करते थे, इसलिए इंजीनियर इसे बताएंगे कि क्या गलत था, या बस समस्या को स्वयं ही पुनर्विकसित कर दिया। जैसे-जैसे विश्वास बढ़ता गया, इनमें से कई सुधार स्वचालित रूप से कोडबेस में विलय होने लगे। एजेंट यह भी रैंक करता है कि PR कितना जटिल है और एजेंट इसके विलय को लेकर कितना आश्वस्त है। हम उस बिंदु पर नहीं हैं जहां ये PRs स्वचालित रूप से विलय हो जाते हैं, लेकिन मुझे वहां एक रास्ता दिख रहा है, मुझे लगता है कि हम एक या दो महीने में वहां होंगे।

लेकिन यह वास्तव में एजेंट को अति बुद्धिमान नहीं बनाता है। अब क्या होता है कि कंपनी के इंजीनियरों और प्रबंधन को एजेंट पर भरोसा हो जाता है, वे उसे काम सौंपना शुरू कर देते हैं और उससे वास्तव में दिलचस्प सवाल पूछना शुरू कर देते हैं। यह उनके लिए शोध करता है, Google खोजों की तरह नहीं बल्कि व्यवसाय के उन्नत ज्ञान को ध्यान में रखकर, जो इसे एक विशेष बढ़त देता है। यही बात कंपनी के अधिक भागों का ज्ञान देने के लिए भी लागू होती है। OpenClaw और HermesAgent ऐतिहासिक रूप से किसी बिंदु पर टूट जाएंगे जहां उनका ऐतिहासिक संदर्भ सूचना को संसाधित करने की उनकी क्षमता से अधिक हो जाएगा। उस प्रकार की विफलता घटित होगी और इसके परिणामस्वरूप बुद्धि, स्मरणशक्ति और उनके काम की गुणवत्ता में भारी गिरावट आएगी। Hermes Agent के साथ हमारा अनुभव अब काफी अलग है: वार्तालाप मेमोरी अब 3 जीबी है और तेजी से बढ़ रही है जबकि समय के साथ इसकी बुद्धिमत्ता में स्पष्ट रूप से सुधार हो रहा है।

इसका मतलब यह नहीं है कि यह एकदम सही है, इसमें प्रतिगमन हैं और आपको कभी-कभी इसे कुछ खास तरीकों से व्यवहार करने के लिए याद दिलाना पड़ता है या यह पहचानना पड़ता है कि यह किसी विशेष संदर्भ में आपकी अपेक्षा के अनुरूप व्यवहार क्यों नहीं कर रहा है या किसी अन्य एजेंट को सही ढंग से जवाब नहीं दे रहा है जो इससे डेटा या कार्यों का अनुरोध करता है। लेकिन, हम वहां पहुंच रहे हैं।

स्लैक थ्रेड जहां एजेंट पुल अनुरोध 4986 की समीक्षा करता है, उसके द्वारा चलाए गए चेक को सूचीबद्ध करता है और उसे अनुमोदित करता है

शाखा सुरक्षा के एक अप्रत्याशित दुष्प्रभाव ने हमें एक और उन्नति दिलाई। शाखा सुरक्षा के पीछे विचार यह है कि कम से कम दो लोग PR को उत्पादन में आने से पहले देखते हैं, जिससे सिस्टम में खराब (या यहां तक ​​कि नापाक) कोड के आने की संभावना कम हो जाती है। नए कोडिंग एजेंटों के साथ इसे ठीक से करना कठिन और कठिन होता जा रहा है। जैसे-जैसे वेग बढ़ता है, नए PRs की दर और कोड की मात्रा की हाथ से पूरी तरह से समीक्षा करना लगभग असंभव है। हमारे पास विभिन्न विक्रेताओं के कई एजेंट हैं जो बग, सुरक्षा मुद्दों और वास्तुशिल्प समस्याओं के लिए पीआरएस की समीक्षा करते हैं। हालाँकि, शाखा सुरक्षा बनी रहती है, इसलिए मैंने हमारे सुपरइंटेलिजेंट एजेंट को PRs का अंतिम अनुमोदनकर्ता बनने की अनुमति दी।

स्लैक थ्रेड जहां एजेंट एमसीपी प्रतिक्रिया अनुबंध में एक ब्रेकिंग परिवर्तन खोजने के बाद पुल अनुरोध 4981 पर परिवर्तन का अनुरोध करता है

हमें आधी उम्मीद थी कि परिणाम नीरस होंगे। आख़िरकार, इन PRs ने स्थानीय कोडिंग एजेंट समीक्षाओं, परीक्षणों, सुरक्षा समीक्षाओं, बाहरी GitHubCopilot और CodeRabbit समीक्षाओं को पारित कर दिया और पूरी तरह से स्वीकृत हो गए। लेकिन हमारे एजेंट ने फिर भी उन PRs में छेद कर दिया। इसमें वास्तव में दिलचस्प किनारे वाले मामले पाए गए जो हम चूक गए, सुरक्षा, सॉफ़्टवेयर गुणवत्ता और वास्तुशिल्प बग जिन पर हमने विचार नहीं किया। यह अन्य सभी समीक्षकों के समान मॉडल का उपयोग करता है, यह उन चीजों का पता क्यों लगा रहा है जो अन्य नहीं कर रहे थे?

स्लैक थ्रेड जहां एजेंट अपलोड आकार सीमा से अधिक पुल अनुरोध 1711 को अस्वीकार कर देता है, फिर फिक्स सत्यापित होने के बाद इसे फिर से स्वीकृत करता है

यह ज्ञान और अनुभव पर निर्भर करता है। Hermes Agent हार्नेस एजेंट द्वारा संचित ज्ञान के साथ मिलकर एक नए प्रकार का सुपरइंटेलिजेंट एजेंट बनाता है जिसे हमने पहले नहीं देखा है। इसलिए, हमने इसकी और खोज की और एजेंट की समीक्षाओं को न केवल सिस्टम पर काम करने वाले मनुष्यों के लिए अनिवार्य बना दिया, बल्कि अब यह अन्य, कम बुद्धिमान एजेंटों के लिए एक संदर्भ के रूप में कार्य करता है!

इस एजेंट के पास अब हमें आलोचनात्मक सोच देने की क्षमता है जो हमने पहले केवल मनुष्यों में देखी थी, लेकिन वास्तविक ग्राहक डेटा, फीडबैक, हमारे कोड और उत्पाद की गहरी समझ द्वारा समर्थित है।

यदि हम इस पर विस्तार करते हैं, और इसे फ़ीड करने के लिए अधिक डेटा देते हैं, इसके हार्डवेयर और मेमोरी को स्केल करते हैं, तो हम प्रदर्शन में तेजी से वृद्धि देखने जा रहे हैं। मुझे लगता है कि मॉडल अभी भी इसे रोके हुए हैं। जब हम इस गेम के अगले चरण में पहुंचेंगे, शायद GPT-6 के माध्यम से, तो परिणाम नाटकीय रूप से अधिक दिलचस्प होंगे। जैसे-जैसे हम अधिक डेटा जमा करते हैं, एजेंटों को करने के लिए अधिक कार्य देते हैं और उस पर अधिक भरोसा करते हैं।

यह कारपैथी के विकी आधारित दूसरे मस्तिष्क से किस प्रकार भिन्न है?

जो बात इसे अन्य दृष्टिकोणों से अलग बनाती है वह यह है कि साझा ज्ञान से निपटने के बजाय, सुपरएजेंट ज्ञान को स्थानीय रूप से संग्रहीत किया जाता है। हम इसे एक रेपो में अपनी स्वयं की स्मृति और दुनिया की समझ को बनाए रखने के लिए कह सकते हैं, जो हमें इसकी नकल करने और इसकी निगरानी करने की अनुमति देता है, लेकिन अंततः यह नहीं ज्ञान और कौशल को साझा करने योग्य और सहयोगात्मक बनाने के बारे में। यह एक अद्वितीय नॉलेजबेस है, जो टूल और विश्व पहुंच के साथ, इसे सीधे आपके प्रश्नों का उत्तर देता है। आप अपने एजेंट से साझा ज्ञान का उपयोग करके इसका पता लगाने के लिए नहीं कहते हैं, या तो आप या आपके एजेंट सुपरइंटेलिजेंट एजेंट से आपके प्रश्न पूछते हैं। हैरानी की बात यह है कि यह अभी हमारे लिए इस हद तक अच्छा काम कर रहा है कि हम लगातार एजेंट की पहुंच और पहुंच का विस्तार कर रहे हैं और परिणामस्वरूप हमें अभी तक खराब ज्ञान या बुद्धि नहीं दिख रही है।

ध्यान दें: हम एजेंट को संवेदनशील जानकारी या कार्यक्षमता से अवगत नहीं करा रहे हैं। इसकी हमारे बैंकिंग, चार्जिंग या बिलिंग सिस्टम तक सीधी पहुंच नहीं है। यह दुनिया से भी अलग है और इसकी ईमेल या बाहरी चैनलों तक पहुंच नहीं है। जैसे-जैसे हम अनुभव और विश्वास हासिल करते हैं, मुझे नहीं लगता कि हम इन प्रतिबंधों को हटाने से बहुत दूर हैं।



|

CTO