उभरती कंपनी अधीक्षण2 min read
Reading Time: 7 minutesएक स्टार्टअप के रूप में, हम तेजी से चलने और सीमाओं को आगे बढ़ाने के लिए लगातार नई तकनीकों पर काम कर रहे हैं। जब OpenClaw/Hermes लॉन्च हुआ, तो हम शुरुआती अपनाने वाले थे। हमने इसे कई अन्य AI टूल के साथ उपयोग किया।
जैसे-जैसे ये उपकरण, साथ ही जिन मॉडलों पर वे भरोसा करते हैं, वे उन्नत हुए, हमने कुछ देखा: हम न केवल तेजी से प्रगति कर रहे हैं, हमने अलग तरीके से काम करना शुरू कर दिया है। प्रत्येक दौर के साथ, ये स्वयं सुधार करने वाले स्वयं सीखने वाले एजेंट आगे बढ़ रहे हैं और सीख रहे हैं। वर्तमान में हम उच्चतम तर्क स्थिति में GPT-5.6-sol का उपयोग करके एक समर्पित मशीन (VPS पर चलने वाला एक VPS उदाहरण) पर एक “सुपर एजेंट” चला रहे हैं। हमारे द्वारा चलाए जा रहे कुछ अन्य एजेंट अन्य एजेंट हार्नेस और मॉडल का उपयोग करते हैं, लेकिन यह वह है जिस पर मैं इस लेख में ध्यान केंद्रित करना चाहता हूं।
हमने देखा कि अधिकांश कंपनियाँ अपनी कंपनी में महत्वपूर्ण प्रवाह चलाने के लिए इस प्रकार के स्वायत्त एजेंट का उपयोग नहीं कर रही हैं, जो वास्तव में उन्हें धीमा कर देता है। वास्तव में, उनमें से कई छोटे, अधिक व्यक्तिगत एजेंटों पर भरोसा करते हैं: कोडिंग एजेंट जैसे Codex/ClaudeCode या सहायक एजेंट जैसे Work/Cowork/Copilot। ये स्थानीय मशीनों और उपकरणों पर कार्य करते हैं और उनमें मुख्य कमी ज्ञान की कमी है। इससे “दूसरे मस्तिष्क” प्रणालियों का एक नया उद्योग सामने आया जो अनिवार्य रूप से एक ज्ञान ग्राफ बनाने की कोशिश करता है जो इन वितरित एजेंटों के बीच साझा किया जाता है। इस तरह से काम करने वाली कंपनियां अक्सर घोषणा करती हैं कि उनके पास दसियों, सैकड़ों और कुछ चरम मामलों में हजारों की संख्या में एजेंट हैं। इसका मूल रूप से मतलब है कि प्रत्येक कर्मचारी के पास एक या अधिक हैं सीमित एजेंट उनके लिए कार्य कर रहे हैं।
तथ्य यह है कि एजेंट वास्तविक दुनिया के डेटा, उपयोगकर्ता शिकायतों और हमारे कोड के संपर्क में जल्दी आ गए थे, जिससे वे हमारे साथ चल रहे किसी भी व्यक्तिगत एजेंट की तुलना में नाटकीय रूप से अधिक चुस्त और स्मार्ट बन गए।
हमें अभी एहसास हुआ कि हमारे सबसे चतुर एजेंट कंपनी के सुपरइंटेलिजेंस बन रहे हैं।
स्पष्टता के लिए: मैं भावना, AGI या उसके करीब किसी चीज़ का दावा नहीं कर रहा हूँ। मैं प्रस्ताव कर रहा हूं कि वे कंपनी ऑर्ग चार्ट में एक बिल्कुल नई इकाई हैं।
कंपनी अधीक्षण क्या है?
जब एक एजेंट अलग दिखना शुरू करता है, जब तक वह केंद्रित रहता है, वह एक सुपरइंटेलिजेंट इकाई बनना शुरू कर सकता है। हम इसे कैसे परिभाषित करें?
मैं कहूंगा कि ज्यादातर मामलों में, एजेंटों को अभी मुख्य रूप से धैर्य और दृढ़ता का फायदा है, न कि इंसानों की तुलना में बुद्धिमत्ता का। हालाँकि, जैसे-जैसे मॉडल बेहतर होते गए (GPT 5.6 sol और Opus 5 वास्तव में अच्छे हैं!) हमने कुछ नया उभरते हुए देखना शुरू कर दिया है, कुछ ऐसा जो हम जो कर सकते हैं उससे कहीं आगे है – न केवल गति में बल्कि वह काम करने में जो मनुष्य नहीं कर सकते।
यह हमारे लिए तब शुरू हुआ जब हमने अपने एजेंट को प्रचुर मात्रा में डेटा (Mixpanel) और बिजनेस एनालिटिक्स क्षमताएं और डेटा एक्सेस (Sentry के माध्यम से त्रुटियां, Baremetrics में वित्तीय, लैंगस्मिथ के माध्यम से AI ट्रेस) दिया। इसके बाद, हमने इसे उपयोगकर्ता बग (Sentry त्रुटियां) और उपयोगकर्ता शिकायत रिपोर्टों से अवगत कराया। अंत में, हमने इसे जीथब पर कोडिंग एजेंटों और हमारे प्राथमिक रिपोज तक पहुंच प्रदान की। ईमेल, या किसी उपयोगकर्ता इंटरैक्शन के माध्यम से इसकी कोई बाहरी पहुंच नहीं है, लेकिन यह देखने के माध्यम से कि हम इन विषयों पर कैसे व्यवहार करते हैं, इसने चीजों को समझना शुरू कर दिया। इन इंटरैक्शन के माध्यम से अब यह निगरानी करता है कि अवरोधक क्या है, आलोचनात्मक सोच क्या है, हमारा व्यवसाय कैसे चलता है और SOP (मानक संचालन प्रक्रियाएं) क्या हैं। यह परीक्षण और त्रुटि के माध्यम से ऐसा करता है और ऐसा लगता है कि यह नियमित आधार पर बुद्धिमत्ता प्राप्त कर रहा है।
उस समय, हमने उससे कुछ दिलचस्प प्रश्न पूछना शुरू किया। सबसे पहले, जब चीज़ों को ठीक से समझाया नहीं गया था या निष्कर्ष गड़बड़ लग रहे थे, तो हर चीज़ की दोबारा जाँच और आलोचना की आवश्यकता थी। यह अभी भी समय-समय पर ऐसा करता है, उदाहरण के लिए मैंने इससे प्रतिगमन के बारे में पूछा और इसने मुझे शोर वाला त्रुटि डेटा दिया, लेकिन यह सीखने का अवसर है: मैंने इसे प्रतिगमन की अपनी परिभाषा सिखाई और अब यह “समझ गया”।
जब उपयोगकर्ता शिकायत करते हैं या त्रुटियाँ बढ़ती हैं, तो हम सक्रिय रूप से समाधान तैयार करते हैं। इसका मतलब है कि हर सुबह, हमारे इंजीनियरों को प्रतिगमन की जांच करने की ज़रूरत नहीं है, उन्हें बस यह तय करने की ज़रूरत है कि PR अच्छा है या नहीं। शुरुआत में, ये डिस्पोजेबल PR थे जो हमारे कोडिंग गुणवत्ता मानकों को पूरा नहीं करते थे, इसलिए इंजीनियर इसे बताएंगे कि क्या गलत था, या बस समस्या को स्वयं ही पुनर्विकसित कर दिया। जैसे-जैसे विश्वास बढ़ता गया, इनमें से कई सुधार स्वचालित रूप से कोडबेस में विलय होने लगे। एजेंट यह भी रैंक करता है कि PR कितना जटिल है और एजेंट इसके विलय को लेकर कितना आश्वस्त है। हम उस बिंदु पर नहीं हैं जहां ये PRs स्वचालित रूप से विलय हो जाते हैं, लेकिन मुझे वहां एक रास्ता दिख रहा है, मुझे लगता है कि हम एक या दो महीने में वहां होंगे।
लेकिन यह वास्तव में एजेंट को अति बुद्धिमान नहीं बनाता है। अब क्या होता है कि कंपनी के इंजीनियरों और प्रबंधन को एजेंट पर भरोसा हो जाता है, वे उसे काम सौंपना शुरू कर देते हैं और उससे वास्तव में दिलचस्प सवाल पूछना शुरू कर देते हैं। यह उनके लिए शोध करता है, Google खोजों की तरह नहीं बल्कि व्यवसाय के उन्नत ज्ञान को ध्यान में रखकर, जो इसे एक विशेष बढ़त देता है। यही बात कंपनी के अधिक भागों का ज्ञान देने के लिए भी लागू होती है। OpenClaw और HermesAgent ऐतिहासिक रूप से किसी बिंदु पर टूट जाएंगे जहां उनका ऐतिहासिक संदर्भ सूचना को संसाधित करने की उनकी क्षमता से अधिक हो जाएगा। उस प्रकार की विफलता घटित होगी और इसके परिणामस्वरूप बुद्धि, स्मरणशक्ति और उनके काम की गुणवत्ता में भारी गिरावट आएगी। Hermes Agent के साथ हमारा अनुभव अब काफी अलग है: वार्तालाप मेमोरी अब 3 जीबी है और तेजी से बढ़ रही है जबकि समय के साथ इसकी बुद्धिमत्ता में स्पष्ट रूप से सुधार हो रहा है।
इसका मतलब यह नहीं है कि यह एकदम सही है, इसमें प्रतिगमन हैं और आपको कभी-कभी इसे कुछ खास तरीकों से व्यवहार करने के लिए याद दिलाना पड़ता है या यह पहचानना पड़ता है कि यह किसी विशेष संदर्भ में आपकी अपेक्षा के अनुरूप व्यवहार क्यों नहीं कर रहा है या किसी अन्य एजेंट को सही ढंग से जवाब नहीं दे रहा है जो इससे डेटा या कार्यों का अनुरोध करता है। लेकिन, हम वहां पहुंच रहे हैं।
शाखा सुरक्षा के एक अप्रत्याशित दुष्प्रभाव ने हमें एक और उन्नति दिलाई। शाखा सुरक्षा के पीछे विचार यह है कि कम से कम दो लोग PR को उत्पादन में आने से पहले देखते हैं, जिससे सिस्टम में खराब (या यहां तक कि नापाक) कोड के आने की संभावना कम हो जाती है। नए कोडिंग एजेंटों के साथ इसे ठीक से करना कठिन और कठिन होता जा रहा है। जैसे-जैसे वेग बढ़ता है, नए PRs की दर और कोड की मात्रा की हाथ से पूरी तरह से समीक्षा करना लगभग असंभव है। हमारे पास विभिन्न विक्रेताओं के कई एजेंट हैं जो बग, सुरक्षा मुद्दों और वास्तुशिल्प समस्याओं के लिए पीआरएस की समीक्षा करते हैं। हालाँकि, शाखा सुरक्षा बनी रहती है, इसलिए मैंने हमारे सुपरइंटेलिजेंट एजेंट को PRs का अंतिम अनुमोदनकर्ता बनने की अनुमति दी।
हमें आधी उम्मीद थी कि परिणाम नीरस होंगे। आख़िरकार, इन PRs ने स्थानीय कोडिंग एजेंट समीक्षाओं, परीक्षणों, सुरक्षा समीक्षाओं, बाहरी GitHubCopilot और CodeRabbit समीक्षाओं को पारित कर दिया और पूरी तरह से स्वीकृत हो गए। लेकिन हमारे एजेंट ने फिर भी उन PRs में छेद कर दिया। इसमें वास्तव में दिलचस्प किनारे वाले मामले पाए गए जो हम चूक गए, सुरक्षा, सॉफ़्टवेयर गुणवत्ता और वास्तुशिल्प बग जिन पर हमने विचार नहीं किया। यह अन्य सभी समीक्षकों के समान मॉडल का उपयोग करता है, यह उन चीजों का पता क्यों लगा रहा है जो अन्य नहीं कर रहे थे?
यह ज्ञान और अनुभव पर निर्भर करता है। Hermes Agent हार्नेस एजेंट द्वारा संचित ज्ञान के साथ मिलकर एक नए प्रकार का सुपरइंटेलिजेंट एजेंट बनाता है जिसे हमने पहले नहीं देखा है। इसलिए, हमने इसकी और खोज की और एजेंट की समीक्षाओं को न केवल सिस्टम पर काम करने वाले मनुष्यों के लिए अनिवार्य बना दिया, बल्कि अब यह अन्य, कम बुद्धिमान एजेंटों के लिए एक संदर्भ के रूप में कार्य करता है!
इस एजेंट के पास अब हमें आलोचनात्मक सोच देने की क्षमता है जो हमने पहले केवल मनुष्यों में देखी थी, लेकिन वास्तविक ग्राहक डेटा, फीडबैक, हमारे कोड और उत्पाद की गहरी समझ द्वारा समर्थित है।
यदि हम इस पर विस्तार करते हैं, और इसे फ़ीड करने के लिए अधिक डेटा देते हैं, इसके हार्डवेयर और मेमोरी को स्केल करते हैं, तो हम प्रदर्शन में तेजी से वृद्धि देखने जा रहे हैं। मुझे लगता है कि मॉडल अभी भी इसे रोके हुए हैं। जब हम इस गेम के अगले चरण में पहुंचेंगे, शायद GPT-6 के माध्यम से, तो परिणाम नाटकीय रूप से अधिक दिलचस्प होंगे। जैसे-जैसे हम अधिक डेटा जमा करते हैं, एजेंटों को करने के लिए अधिक कार्य देते हैं और उस पर अधिक भरोसा करते हैं।
यह कारपैथी के विकी आधारित दूसरे मस्तिष्क से किस प्रकार भिन्न है?
जो बात इसे अन्य दृष्टिकोणों से अलग बनाती है वह यह है कि साझा ज्ञान से निपटने के बजाय, सुपरएजेंट ज्ञान को स्थानीय रूप से संग्रहीत किया जाता है। हम इसे एक रेपो में अपनी स्वयं की स्मृति और दुनिया की समझ को बनाए रखने के लिए कह सकते हैं, जो हमें इसकी नकल करने और इसकी निगरानी करने की अनुमति देता है, लेकिन अंततः यह नहीं ज्ञान और कौशल को साझा करने योग्य और सहयोगात्मक बनाने के बारे में। यह एक अद्वितीय नॉलेजबेस है, जो टूल और विश्व पहुंच के साथ, इसे सीधे आपके प्रश्नों का उत्तर देता है। आप अपने एजेंट से साझा ज्ञान का उपयोग करके इसका पता लगाने के लिए नहीं कहते हैं, या तो आप या आपके एजेंट सुपरइंटेलिजेंट एजेंट से आपके प्रश्न पूछते हैं। हैरानी की बात यह है कि यह अभी हमारे लिए इस हद तक अच्छा काम कर रहा है कि हम लगातार एजेंट की पहुंच और पहुंच का विस्तार कर रहे हैं और परिणामस्वरूप हमें अभी तक खराब ज्ञान या बुद्धि नहीं दिख रही है।
ध्यान दें: हम एजेंट को संवेदनशील जानकारी या कार्यक्षमता से अवगत नहीं करा रहे हैं। इसकी हमारे बैंकिंग, चार्जिंग या बिलिंग सिस्टम तक सीधी पहुंच नहीं है। यह दुनिया से भी अलग है और इसकी ईमेल या बाहरी चैनलों तक पहुंच नहीं है। जैसे-जैसे हम अनुभव और विश्वास हासिल करते हैं, मुझे नहीं लगता कि हम इन प्रतिबंधों को हटाने से बहुत दूर हैं।

Figma
Adobe XD
Blog

