ClawWork: AI Agent Kiếm $19K Trong 8 Giờ?

Nguồn: GitHub API 25/08/2026 · GDPval paper (arXiv 2510.04374) · HN #47040439 · ← Nghiên cứu

Kết luận trước: ClawWork là benchmark nghiên cứu có ý tưởng hay — nhưng "$19K" KHÔNG phải tiền thật. Đó là điểm số do một LLM khác chấm, nhân với bảng lương. Và dự án đã ngừng phát triển 6 tháng.
先講結論:ClawWork 是有價值的研究型 benchmark——但「$19K」不是真錢,是 LLM 評審分數乘上薪資表。而且專案已停擺六個月。

ClawWork là gì

HKU Data Intelligence Lab (HKUDS — cùng nhóm LightRAG, nanobot) phát hành 15/02/2026: cho AI agent nhận nhiệm vụ nghề nghiệp thật từ dataset GDPVal của OpenAI (220 task gold chuẩn, 44 nghề), bắt đầu với $10, mỗi token sinh ra đều trừ tiền, hoàn thành task thì được 'trả lương'. Vòng lặp cốt lõi: quyết định làm việc hay học → thực thi → LLM chấm điểm → nhận thanh toán.
港大 HKUDS 實驗室(LightRAG、nanobot 同一組織)2026/2/15 發布:讓 agent 從 OpenAI 的 GDPVal 資料集接真實職業任務(220 個金標任務、44 個職業),從 $10 起步、每個 token 都扣錢,完成任務賺「薪水」。核心循環:決定工作還是學習→執行→LLM 評分→付款。
Bản thân ý tưởng 'đo agent bằng sức sống kinh tế' là đóng góp thật: không hỏi 'thi đậu không' mà hỏi 'tự nuôi nổi bản thân không'. Ba chiều đo — chất lượng công việc, hiệu quả chi phí, khả năng sống sót — gần production hơn điểm benchmark truyền thống.
「用經濟存活度測 agent」這個概念本身是真貢獻:不問考試過不過,問能不能自己養活自己。品質、成本效率、存活三個維度確實比傳統分數更接近生產環境。

Bốn dấu hiệu đỏ khi kiểm chứng

1. Con số tiêu đề liên tục thổi phồng. Cùng một thời điểm: mô tả repo ghi "$15K in 11 Hours", README ghi "$19K in 8 Hours", bản fork mirror sớm hơn ghi "$10K in 7 Hours". Ba tuần, ba con số, mỗi lần lại giật tít hơn — đây là marketing number được iterate, không phải kết quả test hội tụ.
頭條數字持續膨風:同一時間點 repo 描述寫 $15K/11hr、README 寫 $19K/8hr、更早的鏡像 fork 寫 $10K/7hr。三週三個說法一次比一次聳動——行銷數字在迭代,不是測試在收斂。
2. Tiền là vòng lặp tự chứng minh. Công thức thanh toán: payment = quality_score × (giờ ước tính × lương BLS), mà quality_score do GPT-5.2 làm giám khảo chấm. Paper GDPval gốc thừa nhận: grader tự động chỉ đồng ý với chuyên gia người 66% (người với người cũng chỉ 71%). Tức 'thu nhập' là quan điểm của một LLM có xác suất sai ~1/3, nhân với bảng lương. Mức "lương $2.285/giờ" của agent top đứng trên nền đó.
付款公式=LLM 評審分數 ×(估時 × BLS 薪資)。GDPval 原論文自認自動評分與人類專家一致率僅 66%(人類互評也才 71%)。「收入」是有三分之一機率打錯的 LLM 觀點乘上工資表。冠軍「時薪 $2,285」就站在這個基礎上。
3. Dự án đã chết 6 tháng. Commit cuối: 03/03/2026. Các PR sửa sandbox bug, sửa công bằng leaderboard (#45–#51) mở suốt nửa năm không ai merge. Chỉ 2 dev thực chất (yuh-yang chiếm 68% commit). 8.510★ tập trung trong 2 tuần ra mắt rồi đứng yên.
最後 commit 2026/3/3。修 sandbox、修排行榜公平性的 PR 開了半年沒人合。實質開發者兩人(一人佔 68% commit)。8.5 千星集中在發布兩週內,之後停滯。
4. Cộng đồng lạnh so với sao. Thread Hacker News chỉ 3 điểm, 1 bình luận. r/LocalLLaMA từng chỉ trích hệ sinh thái OpenClaw là 'manufactured hype'. Ngôi sao đến từ máy truyền thông phòng lab, không từ developer dùng thật.
HN 討論串只有 3 分 1 留言;r/LocalLLaMA 早批評過 OpenClaw 生態的製造式炒作。星數來自實驗室宣傳機器,不是開發者實際採用。

Cái nào đáng tin

Nhiệm vụ nguồn là thật: GDPVal là benchmark chính thức của OpenAI (arXiv 2510.04374), 220 task gold có thể kiểm chứng độc lập. TrackedProvider — lớp ghi sổ can thiệp mọi lời gọi LLM để trừ chi phí — là pattern kỹ thuật sạch, MIT license, không black-box.
任務來源是真的:GDPVal 是 OpenAI 官方 benchmark(arXiv 2510.04374),220 金標任務可獨立驗證。TrackedProvider 攔截每次 LLM 呼叫記帳的模式乾淨好用,MIT 授權、無黑箱。
Hướng 'economic survival benchmark' đang được nhóm nghiêm túc hơn theo đuổi: Artificial Analysis xây GDPval-AA với chấm điểm cặp ẩn danh + hội đồng 3 giám khảo. Nghĩa là ý tưởng đúng, nhưng ClawWork chưa phải phiên bản thực thi tốt nhất.
「經濟存活 benchmark」這個方向已有更嚴謹的做法:Artificial Analysis 的 GDPval-AA 用匿名成對比較+三位評審團。想法是對的,但 ClawWork 不是最好的執行者。

Bài học: bộ lọc 4 câu trước khi tin con số AI kiếm tiền

1) Ai trả tiền thật? — ClawWork: không ai, chỉ có LLM chấm điểm. 2) Điểm đến từ đâu — người hay máy? — máy, và chính paper gốc thừa nhận lệch 1/3. 3) Repo còn sống không? — commit cuối 6 tháng trước, PR dở dang. 4) Ai đang dùng thật, ngoài người đăng? — HN 3 điểm, không case doanh nghiệp.
四題過濾法,之後看任何「agent 變現」專案都適用:一、誰付真錢?ClawWork 沒有人,只有 LLM 打分。二、分數誰給的?機器,且原論文自認偏差三分之一。三、專案還活著嗎?commit 停在半年前、PR 沒人收。四、除了發文的人,誰真的在用?HN 三分,零企業案例。

Phương pháp & giới hạn

Số liệu lấy trực tiếp GitHub API ngày 25/08/2026 (commits, contributors, issues, PR); tiêu đề các fork mirror đối chiếu qua kết quả tìm kiếm. Nhận định về độ tin cậy của LLM-judge trích từ paper GDPval gốc (OpenAI, arXiv 2510.04374 — mức đồng thuận 66% máy/người, 71% người/người). Bài viết là phân tích quan điểm có trích dẫn đầy đủ, không phải đánh giá toàn diện codebase — chúng tôi chưa chạy thử ClawWork.
數據於 2026/8/25 直接取自 GitHub API(commits、contributors、issues、PR);fork 鏡像標題經搜尋比對。LLM 評審可信度的引用出自 GDPval 原論文(OpenAI, arXiv 2510.04374:機器對人類一致率 66%、人類互評 71%)。本文為附完整出處的觀點分析,非全面程式碼審查——我們沒有實際運行 ClawWork。

AI Thức · Tất cả bài Nghiên cứu · Trang chủ