TopGit
Đánh giá repo GitHub

BrowserAct: CLI tự động hóa trình duyệt cho AI Agent

browser-act/skills
BTopGit review image for browser-act/skills
Review by Topgit.dev for browser-act/skills, with GitHub repository stats and README context.
Nhận định nhanh

BrowserAct xứng đáng cho các AI agent cần tương tác với web trực tiếp thay vì chỉ gọi API. Các lớp chống bot là thật — giả mạo dấu vân tay, xoay TLS và xoay proxy kết hợp để ngăn chặn hầu hết các chặn ngay từ đầu, với giải CAPTCHA làm phương án dự phòng và chuyển giao cho người từ xa làm giải pháp cuối cùng. Hãy dùng nó khi agent của bạn cần cào các trang yêu cầu xác thực, chạy các quy trình làm việc tài khoản song song, hoặc xử lý các trang web chủ động chống lại tự động hóa; hãy bỏ qua nếu bạn chỉ cần các yêu cầu HTTP đơn giản, hoặc nếu stack của bạn đã có Playwright được bọc trong một lớp chống phát hiện tùy chỉnh.

Sao
★ 5.4k
Fork
⑂ 253
Người đóng góp
👥 12
Ngôn ngữ
Python
Giấy phép
MIT
Chủ đề
Developer Tools
Cập nhật
Aug 2026
Trang chủ
GitHub

What BrowserAct Offers for AI Agents

BrowserAct là một CLI cung cấp cho AI agent các phiên bản Chrome thực, có thể điều khiển với các lớp phòng thủ chống bot tích hợp. Nó phơi bày một bộ lệnh để mở trang, nhấp theo chỉ mục, nhập vào trường và trích xuất nội dung — được thiết kế để tối ưu hiệu quả đầu ra của LLM thay vì dễ đọc đối với con người. Các chế độ trình duyệt bao gồm tái sử dụng hồ sơ Chrome cục bộ, ẩn danh dấu vân tay mới cho cào dữ liệu theo lô không ma sát, và ẩn danh với định danh cố định cho công việc đa tài khoản đã đăng nhập. Hệ thống Skills cho phép agent khám phá các lệnh có sẵn và trạng thái trình duyệt chỉ trong một lần gọi.

Core Capabilities for Web Interaction

  • Ba chế độ trình duyệt: tái sử dụng hồ sơ Chrome cục bộ, ẩn danh dấu vân tay mới cho cào dữ liệu theo lô không ma sát, và ẩn danh với định danh cố định cùng IP ổn định cho các phiên đa tài khoản đã đăng nhập
  • Ba lớp chống bot: giả mạo môi trường (dấu vân tay + xoay TLS + proxy), giải CAPTCHA và trích xuất trang ẩn danh ở lớp thực thi, và chuyển giao cho người từ xa làm giải pháp cuối cùng
  • Đồng thời không can thiệp: cookie, dấu vân tay và proxy độc lập giữa các phiên song song để các trang web không thể tương quan chúng
  • Mô hình tương tác theo chỉ mục: `state` trả về danh sách phần tử được đánh chỉ mục; agent nhấp theo số (`click 3`) hoặc nhập theo chỉ mục (`input 2 "text"`) — không yêu cầu phân tích cú pháp DOM
  • Đầu ra văn bản nhỏ gọn: định dạng văn bản thuần túy được đánh chỉ mục thay vì HTML thô hoặc JSON dài dòng, giảm chi phí token trên mỗi trang
  • Hệ thống Skills để agent khám phá: `get-skills core` trả về trạng thái môi trường, các trình duyệt có sẵn và tham chiếu lệnh đầy đủ trong một lần gọi
  • Cổng xác nhận bảo mật: các thao tác nhạy cảm (tạo/xóa trình duyệt, nhập hồ sơ, thay đổi proxy) yêu cầu phê duyệt rõ ràng mỗi lần — được thực thi ở lớp Skill, không phải một công tắc cấu hình
  • Skill Forge và hơn 30 giải pháp dựng sẵn: tự động tạo ra các Skill cào dữ liệu có thể tái sử dụng bằng cách khám phá một trang web một lần, sau đó tái sử dụng đường dẫn ổn định để trích xuất khối lượng lớn
Số sao GitHub của repo này thay đổi thế nào theo thời gian. Nguồn: star-history.com.Xem lịch sử sao

Getting Started with BrowserAct Skills

Hãy yêu cầu AI agent của bạn cài đặt BrowserAct bằng cách sử dụng nguồn Skill của nó: `https://github.com/browser-act/skills/tree/main/browser-act`. Agent chạy `get-skills core --skill-version 2.0.2` để khám phá trạng thái môi trường và các lệnh có sẵn. Cài đặt cục bộ yêu cầu Chrome (hoặc Chromium) trên Windows, macOS hoặc Linux; chế độ quản lý trên đám mây không yêu cầu thiết lập cục bộ nào. Sau khi cài đặt, hãy xác minh bằng một lệnh đơn giản như `browser-act --version` hoặc một lệnh `browser-act stealth-extract` cơ bản trên một URL đã biết.

Automating Tasks with BrowserAct Commands

Các lệnh BrowserAct tuân theo một mẫu dựa trên phiên: `browser-act --session <name> <command>`. Các lệnh cốt lõi bao gồm `browser open <id> <url>` để mở một trang, `state` để liệt kê các phần tử có thể nhấp theo chỉ mục, `click <n>` để tương tác theo số, `input <n> "text"` để nhập vào trường, và `stealth-extract <url>` cho nội dung được bảo vệ trên một trang mà không cần phiên đầy đủ. Đối với các tác vụ song song, hãy chạy nhiều phiên với các tên khác nhau — mỗi phiên sẽ có cookie, dấu vân tay và proxy độc lập. Lệnh `remote-assist` tạo ra một URL trực tiếp để người dùng tiếp quản khi agent bị kẹt. Người dùng Skill Forge mô tả dữ liệu họ cần và agent tạo ra một gói Skill có thể tái sử dụng mà agent có thể chạy theo yêu cầu.

Strengths

  • Được xây dựng có mục đích cho AI agent thay vì người dùng — đầu ra được đánh chỉ mục, quyền sở hữu phiên và bộ nhớ ngữ nghĩa phù hợp với cách LLM thực sự suy luận
  • Stack chống bot thực với các lớp tiến bộ: hầu hết các chặn không bao giờ kích hoạt, giải CAPTCHA xử lý những gì vượt qua, chuyển giao cho người bao gồm phần còn lại
  • Cô lập đa tài khoản hoạt động ngay lập tức — không yêu cầu xóa cookie thủ công hoặc quản lý hồ sơ
  • Gói miễn phí hào phóng: tự động hóa trình duyệt đầy đủ và các tính năng ẩn danh cơ bản mà không cần đăng ký
  • Skill Forge tự động tạo ra các Skill cào dữ liệu có thể tái sử dụng, giảm nhu cầu tự viết scraper cho từng trang web mục tiêu
  • Đa nền tảng: hoạt động trên Windows, macOS và Linux với bất kỳ agent nào có thể thực thi lệnh shell

Understanding BrowserAct's Free and Paid Features

  • Số lượng trình duyệt ẩn danh bị giới hạn ở 5 trên gói miễn phí; proxy được quản lý và các trình duyệt ẩn danh bổ sung yêu cầu tín dụng trả phí
  • Các trang web nặng JavaScript vẫn hoạt động tốt hơn ở chế độ hiển thị so với headless — một số quy trình làm việc cần có màn hình
  • Skill Forge và các tính năng tự động hóa nâng cao yêu cầu đăng nhập BrowserAct, không chỉ cài đặt CLI
  • Mô hình cài đặt dựa trên Skill giả định AI agent của bạn có thể tải các Skill bên ngoài — các agent không có khả năng đó cần thiết lập thủ công
  • Không có mô phỏng trình duyệt di động gốc cho các trang web phục vụ nội dung khác nhau cho user agent di động
  • Chất lượng tài liệu thay đổi; một số tính năng nâng cao (thiết lập proxy, tinh chỉnh dấu vân tay) được đề cập nhưng không được mô tả đầy đủ trong README

Other Tools for AI Agent Web Interaction

Playwright — thư viện tự động hóa trình duyệt đã được thiết lập tốt với hỗ trợ đa ngôn ngữ mạnh mẽ, nhưng thiếu các lớp chống bot, hệ thống Skills và mô hình tương tác gốc agent mà BrowserAct cung cấpPuppeteer — tự động hóa trình duyệt Node.js với công cụ trưởng thành, mặc dù giống như Playwright, nó yêu cầu công việc tùy chỉnh để xử lý phát hiện chống bot và cô lập đa tài khoảnSelenium — framework tự động hóa trình duyệt cũ, tương thích rộng rãi nhưng dài dòng và không được thiết kế cho đầu ra thân thiện với LLM hoặc tránh chống bot hiện đạiOpenClaw — một công cụ tự động hóa web agentic mã nguồn mở mà BrowserAct hỗ trợ rõ ràng như một agent tương thích (BrowserAct có thể được tải dưới dạng Skill trong các quy trình làm việc của OpenClaw)AgentQL — một cách tiếp cận dựa trên truy vấn để trích xuất dữ liệu web sử dụng bộ chọn ngôn ngữ tự nhiên thay vì CSS/XPath, mặc dù nó không bao gồm bỏ qua chống bot tích hợp hoặc quản lý đa phiên

Frequently Asked Questions

Tôi có thể sử dụng BrowserAct miễn phí không, và những tính năng nào được bao gồm?

Có. Gói miễn phí (không cần đăng ký) bao gồm tự động hóa trình duyệt và chế độ Chrome/Chrome-direct. Đăng nhập cho phép sử dụng trình duyệt ẩn danh tối đa 5 phiên, stealth-extract, solve-captcha, remote-assist, chế độ riêng tư và Skill Forge. Các tính năng trả phí bao gồm trình duyệt ẩn danh bổ sung và proxy được quản lý.

BrowserAct vượt qua các biện pháp chống bot và CAPTCHA như thế nào?

BrowserAct sử dụng ba lớp tiến bộ. Thứ nhất, giả mạo môi trường với dấu vân tay ẩn danh, xoay TLS và chuyển đổi proxy ngăn chặn hầu hết các chặn. Thứ hai, solve-captcha tự động giải CAPTCHA ở lớp thực thi. Thứ ba, remote-assist tạo ra một URL trực tiếp để người dùng tiếp quản khi tự động hóa không thể tiếp tục.

BrowserAct có phù hợp để quản lý nhiều tài khoản hoặc tác vụ song song không?

Có. Các phiên chạy với cookie, dấu vân tay và proxy độc lập, vì vậy các trang web không thể tương quan chúng. Bạn có thể chạy đa phiên cùng trình duyệt với trạng thái đăng nhập dùng chung, hoặc các phiên hoàn toàn cô lập cho các tài khoản khác nhau — không cần dọn dẹp thủ công giữa các tác vụ.

BrowserAct tương thích với những AI agent và LLM nào?

Bất kỳ agent nào có khả năng thực thi lệnh shell và tải Skills đều có thể sử dụng BrowserAct. README liệt kê cụ thể Claude Code, Cursor, VS Code, OpenCode, OpenClaw, Codex và Gemini CLI là tương thích.

Skill Forge là gì và nó nâng cao BrowserAct như thế nào?

Skill Forge khám phá một trang web mục tiêu một lần để khám phá cấu trúc và mẫu dữ liệu của nó, sau đó tạo ra một gói Skill sẵn sàng triển khai chạy đáng tin cậy trên các yêu cầu tiếp theo mà không cần khám phá lại. Nó được cung cấp miễn phí khi đăng nhập BrowserAct và cung cấp năng lượng cho hơn 30 giải pháp dựng sẵn bao gồm Amazon, Google Maps, YouTube, Reddit, v.v.

The problem it solves

Các công cụ tự động hóa trình duyệt tiêu chuẩn được xây dựng cho người dùng, không phải cho AI agent cần đầu ra nhỏ gọn, tương tác theo chỉ mục và không nhiễm chéo giữa các tác vụ song song. Hầu hết các scraper thất bại ở các trang web sử dụng fingerprinting hoặc cổng CAPTCHA, và các trình duyệt headless hiện có bị gắn cờ là bot ngay khi truy cập bất kỳ trang web phức tạp nào. Các agent cũng cần một đường dẫn chuyển giao rõ ràng khi gặp phải thứ chúng không thể tự giải quyết.

Best use cases

  • Trích xuất dữ liệu web từ các trang web có bảo vệ chống bot, bao gồm các trang yêu cầu xác thực đăng nhập
  • Cào dữ liệu hoặc tự động hóa song song trên nhiều tài khoản độc lập mà không nhiễm chéo
  • Quy trình làm việc của AI agent cần tương tác trình duyệt thực thay vì gọi API — cho các trang không có API công khai hoặc có các endpoint bị giới hạn tốc độ
  • Chạy các công việc cào dữ liệu lặp lại ở quy mô lớn thông qua các Skill được tạo bởi Skill Forge mà không cần viết mã scraper tùy chỉnh
  • Các kịch bản chuyển giao giữa người và agent, nơi AI xử lý các bước thường lệ và chuyển giao cho người khi gặp CAPTCHA hoặc cảnh báo tài khoản
  • Thu thập dữ liệu theo lô từ các nền tảng thương mại điện tử, mạng xã hội hoặc việc làm sử dụng các Skill dựng sẵn hoặc tùy chỉnh

Who should try it — and who should skip

Hãy thử BrowserAct nếu bạn đang xây dựng các quy trình làm việc của AI agent cần tương tác với web trực tiếp — cào các trang yêu cầu xác thực, tự động hóa các tác vụ liên quan đến tài khoản hoặc trích xuất dữ liệu từ các trang web chủ động chống lại việc cào dữ liệu. Nó đặc biệt hữu ích khi các agent cần làm việc song song mà không nhiễm chéo, hoặc khi bạn muốn có một đường dẫn chuyển giao cho người để xử lý các trường hợp ngoại lệ. Hãy bỏ qua nếu các mục tiêu cào dữ liệu của bạn có API công khai rõ ràng, hoặc nếu bạn đã hài lòng với Playwright cộng với mã chống phát hiện tùy chỉnh — BrowserAct bổ sung giá trị lớn nhất khi khả năng chống bot và UX gốc agent quan trọng hơn tùy chỉnh thô.

Repo liên quan

Nguồn & ghi công

Kho lưu trữ GitHub browser-act/skills (Giấy phép MIT). Sao: 5351, Fork: 253. https://github.com/browser-act/skills

Dữ liệu GitHub · đồng bộ lần cuối 12 thg 8, 2026Đánh giá bởi Henry
Về TopGit

Vẫn đang phân vân về skills?

Một cú bấm sẽ gửi câu hỏi kèm trang này cho AI — xem AI nói gì về skills.

GitHub