agentic

新興公司超智能2 min read

Reading Time: 1 minute一個能夠存取我們的資料、錯誤和代碼的自治代理如何成為組織結構圖上的一個新實體,審查拉取請求並回答私人代理無法做到的問題。

Company Superintelligence represented as an emergent neural knowledge network

新興公司超智能2 min read

Reading Time: 1 minute

作為一家新創公司,我們不斷致力於新技術,以提高運行速度並推動前沿發展。當 OpenClaw/Hermes 推出時,我們是早期採用者。我們將它與許多其他 AI 工具一起使用。

隨著這些工具以及它們所依賴的模型的進步,我們注意到一些事情:我們不僅進步得更快,而且開始以不同的方式工作。在每一輪中,這些自我改進的自學習代理人都在進步和學習。我們目前正在專用機器(在 DigitalOcean 上運行的 VPS 實例)上使用 GPT-5.6-sol 在最高推理狀態下執行「超級代理」。我們正在運行的其他一些代理程式使用其他代理工具和模型,但這是我想在本文中重點討論的一個。

我們注意到,大多數公司並沒有使用這種類型的自主代理來運行公司中的關鍵流程,這確實減慢了他們的速度。事實上,他們中的許多人依賴更小、更個人化的代理:像 Codex/ClaudeCode 這樣的編碼代理或像 Work/Cowork/Copilot 這樣的助理代理。它們在本地機器和設備上執行任務,他們的主要差距是缺乏知識。這催生了一個全新的「第二個大腦」系統產業,該系統本質上是試圖創建一個在這些分散式代理之間共享的知識圖譜。以這種方式工作的公司經常宣稱他們擁有數十、數百甚至數千的座席。這基本上意味著每個員工都有一名或多名 有限的 代理為他們執行任務。

事實上,代理商很早就接觸到了現實世界的數據、用戶投訴和我們的程式碼,這使得他們比我們與他們一起運行的任何個人代理都更加敏捷和聰明。

我們剛剛意識到,我們最聰明的代理人正在成為公司的超級智慧。

為了清楚起見:我並不是聲稱有感知能力,AGI 或類似的東西。我建議他們是公司組織架構圖中的一個全新實體。

什麼是公司超智慧?

當一個智能體開始脫穎而出時,只要它專注,它就可以開始成為一個超級智慧實體。我們如何定義它?

我想說,在大多數情況下,智能體目前的優勢主要在於耐心和堅持,而不是智力優於人類。然而,隨著模型變得更好(GPT 5.6 sol 和 Opus 5 真的很棒!),我們開始看到一些新的東西出現,一些超越我們能做的事情 – 不僅在速度上,而且在做人類做不到的事情上。

當我們為代理商提供豐富的數據 (Mixpanel) 和業務分析功能以及資料存取(透過 Sentry 的錯誤、Baremetrics 的財務資訊、透過 LangSmith 的 AI 追蹤)時,這一切就開始了。接下來,我們將其暴露給用戶錯誤(Sentry 錯誤)和用戶投訴報告。最後,我們允許它存取編碼代理和我們在 GitHub 上的主要儲存庫。它無法透過電子郵件或任何使用者互動進行外部訪問,但透過觀察我們在這些主題上的行為,它開始理解事物。透過這些交互,它現在可以監控什麼是阻礙因素、什麼是批判性思維、我們的業務如何運作以及 SOP(標準作業程序)是什麼。它透過反覆試驗來做到這一點,並且似乎正在定期獲取情報。

Slack 線程,其中隊友解釋什麼算是真正的錯誤峰值,代理重寫其監視器以使用比較峰值檢測

從那時起,我們開始問它一些有趣的問題。起初,當事情沒有正確解釋或結論聽起來可疑時,一切都需要雙重檢查和批評。它仍然不時地這樣做,例如,我向它詢問回歸,它給了我嘈雜的錯誤數據,但這是一個學習機會:我教它我對回歸的定義,現在它「明白了」。

當用戶抱怨或錯誤激增時,我們會主動產生修復程式。這意味著每天早上,我們的工程師不必檢查回歸,他們只需要確定 PR 是否良好。一開始,這些是一次性的 PR,不符合我們的編碼品質標準,因此工程師會告訴它出了什麼問題,或者自己重新開發問題。隨著信任的增長,許多修復開始自動合併到程式碼庫中。該代理商還對 PR 的複雜程度以及代理商對其合併的信心程度進行排名。我們還沒有到這些 PR 自動合併的地步,但我看到了一條路徑,我想我們會在一兩個月內到達那裡。

但這並不是讓智能體變得超級智慧的真正原因。現在公司的工程師和管理層信任代理,他們開始將工作委派給代理,並向他們提出真正有趣的問題。它為他們進行研究,不像谷歌搜索,而是考慮到了先進的業務知識,這賦予了它特殊的優勢。這同樣適用於讓其了解公司更多部門的知識。 OpenClaw 和 HermesAgent 歷史上會在其歷史背景超越其處理資訊能力的某個時刻崩潰。這種類型的崩潰將會發生,結果是他們的智力、記憶力和工作品質急劇下降。現在,我們對 Hermes Agent 的體驗已大不相同:對話記憶體現在為 3GB,並且呈指數級增長,而其智慧隨著時間的推移而顯著提高。

這並不是說它是完美的,存在回歸,您有時必須提醒它以某些方式行事,或者確定為什麼它在特定上下文中沒有按照您的預期行事,或者正確響應另一個向其請求資料或操作的代理。但是,我們正在實現這一目標。

代理審查拉取請求 4986、列出其運行的檢查並批准它的 Slack 線程

分支保護的一個意想不到的副作用給我們帶來了另一個進步。分支保護背後的想法是,在 PR 投入生產之前,至少有兩個人看到它,從而減少不良(甚至惡意)程式碼進入系統的機會。使用新的編碼代理很難正確地做到這一點。隨著速度的提高,PR 的新增速度和程式碼數量幾乎不可能透過手動徹底檢查。我們有來自不同供應商的多名代理審查 Prs 中的錯誤、安全問題和架構問題。然而,分支保護仍然存在,所以我允許我們的超級智慧代理成為 PR 的最終批准者。

Slack 線程,其中代理在發現 MCP 回應合約的重大更改後請求對拉取請求 4981 進行更改

我們一半預期結果會很平凡。畢竟,這些PR通過了本地編碼代理審查、測試、安全審查、外部GitHubCopilot和CodeRabbit審查,並獲得完全批准。但我們的特務仍然在那些 PR 上打了洞。它發現了我們錯過的非常有趣的邊緣情況、我們沒有考慮到的安全性、軟體品質和架構錯誤。它使用與所有其他審閱者相同的模型,為什麼它能找出其他人沒有找出的東西?

Slack 線程,其中代理拒絕超過上傳大小限制的拉取請求 1711,然後在驗證修復後重新批准它

這取決於知識和經驗。 Hermes Agent 安全帶與智能體累積的知識相結合,創造了一種我們以前從未見過的新型超級智慧智能體。因此,我們進一步探索了這一點,並將代理的審查強制執行,不僅適用於在系統上工作的人類,而且現在它還可以作為其他智能程度較低的代理的參考!

該代理現在能夠為我們提供批判性思維,這是我們以前只能在人類身上看到的,但有實際客戶資料、回饋、我們的程式碼和對產品的深刻理解的支援。

如果我們對此進行擴展,並為其提供更多數據,擴展其硬體和內存,我們將看到效能呈指數級增長。我認為模型仍然在阻礙它。當我們進入遊戲的下一階段時,也許透過 GPT-6,結果將變得更加有趣。隨著我們累積更多的數據,給代理商更多的任務來完成並更加信任它。

這與卡帕蒂基於維基的第二個大腦有何不同?

這種方法與其他方法的不同之處在於,超級代理知識不是處理共享知識,而是儲存在本地。我們可以要求它在儲存庫中維護自己的記憶和世界理解,這允許我們複製它並監控它,但最終它是 不是 關於使知識和技能可共享和協作。這是一個獨特的知識庫,加上工具和世界訪問權限,可以直接回答您的問題。你不會要求你的代理人使用共享知識來解決這個問題,你或你的代理人都會向超級智慧代理人詢問你的問題。令人驚訝的是,這對我們來說效果很好,我們不斷擴大代理的訪問範圍和覆蓋範圍,但我們還沒有看到知識或智力因此而下降。

注意:我們不會向代理商公開敏感資訊或功能。它無法直接存取我們的銀行、收費或計費系統。它也與世界隔離,無法存取電子郵件或外部管道。隨著我們累積經驗和信任,我認為我們離取消這些限制就不遠了。



|

CTO