agentic

Công ty siêu trí tuệ mới nổi19 min read

Reading Time: 9 minutesLàm thế nào một nhân viên tự trị duy nhất có quyền truy cập vào dữ liệu, lỗi và mã của chúng tôi trở thành một thực thể mới trên sơ đồ tổ chức, xem xét các yêu cầu kéo và trả lời các câu hỏi mà không nhân viên cá nhân nào có thể làm được.

Company Superintelligence represented as an emergent neural knowledge network

Công ty siêu trí tuệ mới nổi19 min read

Reading Time: 9 minutes

Là một công ty khởi nghiệp, chúng tôi không ngừng nghiên cứu các kỹ thuật mới để chạy nhanh hơn và vượt xa giới hạn. Khi OpenClaw/Hermes ra mắt, chúng tôi đã là người áp dụng sớm. Chúng tôi đã sử dụng nó cùng với nhiều công cụ AI khác.

Khi những công cụ này, cũng như các mô hình mà chúng dựa vào, được nâng cao, chúng tôi nhận thấy một điều: chúng tôi không chỉ phát triển nhanh hơn mà còn bắt đầu hoạt động khác đi. Với mỗi vòng, các tác nhân tự học tự cải thiện này sẽ tiến bộ và học hỏi. Chúng tôi hiện đang chạy một “Siêu tác nhân” trên một máy chuyên dụng (phiên bản VPS chạy trên DigitalOcean) sử dụng GPT-5.6-sol ở trạng thái lý luận cao nhất. Một số tác nhân khác mà chúng tôi đang chạy sử dụng các mô hình và khai thác tác nhân khác, nhưng đây là điều tôi muốn tập trung vào trong bài viết này.

Chúng tôi nhận thấy rằng hầu hết các công ty không sử dụng loại tác nhân tự trị này để vận hành các luồng quan trọng trong công ty của họ, điều này thực sự làm họ chậm lại. Trên thực tế, nhiều người trong số họ dựa vào các tác nhân nhỏ hơn, mang tính cá nhân hơn: các tác nhân mã hóa như Codex/ClaudeCode hoặc các tác nhân trợ lý như Work/Cowork/Copilot. Chúng thực hiện các tác vụ trên máy và thiết bị cục bộ và lỗ hổng chính mà chúng gặp phải là thiếu kiến ​​thức. Điều này dẫn đến một ngành công nghiệp hoàn toàn mới gồm các hệ thống “bộ não thứ hai” về cơ bản cố gắng tạo ra một biểu đồ tri thức được chia sẻ giữa các tác nhân phân tán này. Những công ty làm việc như thế này thường tuyên bố rằng họ có số lượng đại lý lên tới hàng chục, hàng trăm và trong một số trường hợp cực đoan là hàng nghìn. Điều đó về cơ bản có nghĩa là mỗi nhân viên có một hoặc nhiều đại lý. giới hạn đại lý thực hiện nhiệm vụ cho họ.

Thực tế là các nhân viên được tiếp xúc sớm với dữ liệu trong thế giới thực, khiếu nại của người dùng và mã của chúng tôi, khiến họ trở nên linh hoạt và thông minh hơn đáng kể so với bất kỳ nhân viên hỗ trợ cá nhân nào mà chúng tôi đang điều hành cùng họ.

Chúng tôi vừa nhận ra rằng những đặc vụ thông minh nhất của chúng tôi đang trở thành siêu trí tuệ của công ty.

Để rõ ràng: Tôi không yêu cầu khả năng tri giác, AGI hay bất cứ thứ gì gần như vậy. Tôi đề xuất họ là một thực thể hoàn toàn mới trong sơ đồ tổ chức của công ty.

Siêu trí tuệ của công ty là gì?

Khi một đặc vụ bắt đầu nổi bật, miễn là nó tập trung, nó có thể bắt đầu trở thành một thực thể Siêu thông minh. Làm thế nào để chúng ta xác định điều đó?

Tôi có thể nói rằng trong hầu hết các trường hợp, các đặc vụ hiện nay chủ yếu có lợi thế về sự kiên nhẫn và bền bỉ chứ không phải về trí thông minh so với con người. Tuy nhiên, khi các mô hình trở nên tốt hơn (GPT 5.6 sol & Opus 5 thực sự tốt!) chúng tôi bắt đầu thấy điều gì đó mới xuất hiện, điều gì đó vượt xa những gì chúng tôi có thể làm – không chỉ về tốc độ mà còn về việc con người không thể làm được.

Mọi chuyện bắt đầu với chúng tôi khi chúng tôi cung cấp cho đại lý của mình rất nhiều Dữ liệu (Mixpanel) và khả năng phân tích doanh nghiệp cũng như quyền truy cập dữ liệu (lỗi thông qua Sentry, tài chính trong Baremetrics, AI theo dõi thông qua LangSmith). Tiếp theo, chúng tôi đã phát hiện ra lỗi của người dùng (lỗi Sentry) và báo cáo khiếu nại của người dùng. Cuối cùng, chúng tôi đã cấp cho nó quyền truy cập vào các tác nhân mã hóa và kho lưu trữ chính của chúng tôi trên GitHub. Nó không có quyền truy cập từ bên ngoài thông qua email hoặc bất kỳ tương tác nào của người dùng, nhưng thông qua việc xem cách chúng tôi hành xử đối với những chủ đề này, nó bắt đầu hiểu mọi thứ. Thông qua những tương tác này, giờ đây nó giám sát những gì cấu thành một trình chặn, tư duy phản biện là gì, hoạt động kinh doanh của chúng tôi diễn ra như thế nào và SOP (Quy trình vận hành tiêu chuẩn) là gì. Nó thực hiện điều này bằng cách thử và sai và dường như nó thu thập được thông tin tình báo một cách thường xuyên.

Chuỗi sự cố trong đó một đồng đội giải thích những gì được coi là lỗi tăng đột biến thực sự và tác nhân viết lại màn hình của mình để sử dụng tính năng phát hiện đột biến so sánh

Vào thời điểm đó, chúng tôi bắt đầu hỏi nó một số câu hỏi thú vị. Lúc đầu, mọi thứ đều cần phải kiểm tra và phê bình kỹ càng khi mọi thứ không được giải thích hợp lý hoặc kết luận nghe có vẻ khó hiểu. Thỉnh thoảng nó vẫn làm điều này, chẳng hạn như tôi đã hỏi nó về hồi quy và nó cung cấp cho tôi dữ liệu lỗi ồn ào, nhưng đó là một cơ hội học tập: Tôi đã dạy nó định nghĩa về hồi quy và bây giờ nó “hiểu được”.

Khi người dùng phàn nàn hoặc khi lỗi tăng đột biến, chúng tôi chủ động đưa ra các bản sửa lỗi. Điều đó có nghĩa là mỗi buổi sáng, các kỹ sư của chúng tôi không phải kiểm tra hồi quy, họ chỉ cần quyết định xem PR có tốt hay không. Lúc đầu, đây là những chiếc PR dùng một lần không đáp ứng các tiêu chuẩn chất lượng mã hóa của chúng tôi, vì vậy các kỹ sư sẽ cho nó biết điều gì sai hoặc chỉ tự phát triển lại vấn đề. Khi sự tin cậy ngày càng tăng, nhiều bản sửa lỗi này bắt đầu được tự động hợp nhất vào cơ sở mã. Đại lý cũng xếp hạng mức độ phức tạp của PR và mức độ tự tin của đại lý về việc hợp nhất nó. Chúng tôi chưa đến thời điểm mà các PR này được tự động hợp nhất, nhưng tôi thấy một con đường ở đó, tôi cho rằng chúng tôi sẽ đến đó sau một hoặc hai tháng.

Nhưng đó không thực sự là điều khiến đặc vụ trở nên siêu thông minh. Điều làm được là bây giờ các kỹ sư và quản lý của công ty đã tin tưởng vào đại lý, họ bắt đầu giao công việc cho đại lý và hỏi đại lý những câu hỏi thực sự thú vị. Nó thực hiện nghiên cứu cho họ, không giống như tìm kiếm trên Google mà dựa trên kiến ​​thức nâng cao về doanh nghiệp, điều này mang lại cho nó một lợi thế đặc biệt. Điều tương tự cũng áp dụng cho việc cung cấp cho nó kiến ​​thức về nhiều bộ phận khác của công ty. OpenClaw và HermesAgent về mặt lịch sử sẽ bị hỏng tại một thời điểm nào đó khi bối cảnh lịch sử của chúng vượt quá khả năng xử lý thông tin của chúng. Kiểu suy sụp đó sẽ xảy ra và kết quả là trí thông minh, khả năng ghi nhớ và chất lượng công việc của họ bị sụt giảm nghiêm trọng. Trải nghiệm của chúng tôi với Hermes Agent hiện khá khác biệt: bộ nhớ đàm thoại hiện ở mức 3GB và tăng theo cấp số nhân trong khi trí thông minh của nó được cải thiện rõ ràng theo thời gian.

Điều đó không có nghĩa là nó hoàn hảo, có những hồi quy và đôi khi bạn phải nhắc nhở nó hành xử theo những cách nhất định hoặc xác định lý do tại sao nó không hoạt động như bạn mong đợi trong một bối cảnh cụ thể hoặc phản hồi chính xác với một tác nhân khác yêu cầu dữ liệu hoặc hành động từ nó. Nhưng chúng ta đang đến đó.

Chuỗi Slack nơi tác nhân xem xét yêu cầu kéo 4986, liệt kê các kiểm tra mà nó đã chạy và phê duyệt nó

Một tác dụng phụ không mong đợi của việc bảo vệ chi nhánh đã mang lại cho chúng tôi một tiến bộ khác. Ý tưởng đằng sau việc bảo vệ nhánh là ít nhất hai người nhìn thấy PR trước khi nó được đưa vào sản xuất, giảm nguy cơ mã xấu (hoặc thậm chí bất chính) xâm nhập vào hệ thống. Điều này ngày càng khó thực hiện đúng cách với các tác nhân mã hóa mới. Khi tốc độ tăng lên, tốc độ và số lượng mã PR mới gần như không thể xem xét kỹ lưỡng bằng tay. Chúng tôi có nhiều đại lý từ các nhà cung cấp khác nhau xem xét Prs để tìm lỗi, vấn đề bảo mật và vấn đề kiến ​​trúc. Tuy nhiên, việc bảo vệ chi nhánh vẫn được duy trì, vì vậy tôi đã cho phép đặc vụ siêu thông minh của chúng tôi là người phê duyệt cuối cùng cho PR.

Chuỗi chùng nơi tác nhân yêu cầu thay đổi theo yêu cầu kéo 4981 sau khi tìm thấy thay đổi vi phạm đối với hợp đồng phản hồi MCP

Chúng tôi nửa mong đợi rằng kết quả sẽ rất tầm thường. Rốt cuộc, những PR này đã vượt qua các bài đánh giá, kiểm tra, đánh giá bảo mật, đánh giá tác nhân mã hóa cục bộ, đánh giá GitHubCopilot và CodeRabbit bên ngoài và đã được phê duyệt hoàn toàn. Nhưng đặc vụ của chúng tôi vẫn đục lỗ trên những chiếc PR đó. Nó tìm thấy những trường hợp đặc biệt thú vị mà chúng tôi đã bỏ sót, các lỗi về bảo mật, chất lượng phần mềm và kiến ​​trúc mà chúng tôi không xem xét. Nó sử dụng các mô hình giống như tất cả những người đánh giá khác, tại sao nó lại tìm ra những thứ mà những người khác không làm được?

Chuỗi chùng trong đó tác nhân từ chối yêu cầu kéo 1711 vượt quá giới hạn kích thước tải lên, sau đó phê duyệt lại sau khi bản sửa lỗi được xác minh

Nó phụ thuộc vào kiến ​​thức và kinh nghiệm. Bộ khai thác Hermes Agent kết hợp với kiến ​​thức mà tác nhân tích lũy được sẽ tạo ra một loại tác nhân siêu thông minh mới mà chúng ta chưa từng thấy trước đây. Vì vậy, chúng tôi đã khám phá vấn đề này sâu hơn và bắt buộc phải đánh giá tác nhân, không chỉ đối với những người làm việc trên hệ thống mà giờ đây nó đóng vai trò là tài liệu tham khảo cho các tác nhân khác kém thông minh hơn!

Tác nhân này hiện có khả năng cung cấp cho chúng tôi tư duy phản biện mà trước đây chúng tôi chỉ thấy ở người, nhưng được hỗ trợ bởi dữ liệu thực tế của khách hàng, phản hồi, mã của chúng tôi và sự hiểu biết sâu sắc về sản phẩm.

Nếu chúng tôi mở rộng vấn đề này và cung cấp cho nó nhiều dữ liệu hơn để cung cấp, mở rộng quy mô phần cứng và bộ nhớ, chúng tôi sẽ thấy hiệu suất tăng theo cấp số nhân. Tôi nghĩ các người mẫu vẫn đang kìm hãm nó. Khi chúng ta chuyển sang giai đoạn tiếp theo của trò chơi này, có lẽ thông qua GPT-6, kết quả sẽ thú vị hơn nhiều. Khi chúng tôi tích lũy được nhiều dữ liệu hơn, hãy giao cho các tổng đài viên nhiều nhiệm vụ hơn để làm và tin tưởng vào dữ liệu đó hơn.

Điều này khác với bộ não thứ 2 dựa trên Wiki của Karpathy như thế nào?

Điều làm cho phương pháp này khác với các phương pháp khác là thay vì xử lý kiến ​​thức được chia sẻ, kiến ​​thức siêu tác nhân được lưu trữ cục bộ. Chúng tôi có thể yêu cầu nó duy trì bộ nhớ của chính nó và sự hiểu biết về thế giới trong một kho lưu trữ, điều này cho phép chúng tôi sao chép và giám sát nó, nhưng cuối cùng thì đó là không về việc làm cho kiến ​​thức và kỹ năng có thể được chia sẻ và hợp tác. Đó là một cơ sở kiến ​​thức duy nhất, cùng với các công cụ và khả năng tiếp cận thế giới, cho phép nó trả lời trực tiếp các câu hỏi của bạn. Bạn không yêu cầu đại diện của mình tìm ra vấn đề bằng cách sử dụng kiến ​​thức được chia sẻ, bạn hoặc đại diện của bạn sẽ hỏi đại diện Siêu trí tuệ các câu hỏi của bạn. Đáng ngạc nhiên là hiện tại điều này đang hoạt động tốt với chúng tôi đến mức chúng tôi liên tục mở rộng quyền truy cập và phạm vi tiếp cận của đặc vụ và kết quả là chúng tôi vẫn chưa thấy kiến ​​thức hoặc trí thông minh bị suy giảm.

Lưu ý: chúng tôi không để tác nhân tiếp xúc với thông tin hoặc chức năng nhạy cảm. Nó không có quyền truy cập trực tiếp vào hệ thống ngân hàng, tính phí hoặc thanh toán của chúng tôi. Nó cũng tách biệt với thế giới và không có quyền truy cập vào email hoặc các kênh bên ngoài. Khi chúng ta có được kinh nghiệm và sự tin tưởng, tôi không nghĩ chúng ta còn lâu mới dỡ bỏ được những hạn chế này.



|

CTO