BrowserAct: CLI tự động hóa trình duyệt cho AI Agent
BrowserAct xứng đáng cho các AI agent cần tương tác với web trực tiếp thay vì chỉ gọi API. Các lớp chống bot là thật — giả mạo dấu vân tay, xoay TLS và xoay proxy kết hợp để ngăn chặn hầu hết các chặn ngay từ đầu, với giải CAPTCHA làm phương án dự phòng và chuyển giao cho người từ xa làm giải pháp cuối cùng. Hãy dùng nó khi agent của bạn cần cào các trang yêu cầu xác thực, chạy các quy trình làm việc tài khoản song song, hoặc xử lý các trang web chủ động chống lại tự động hóa; hãy bỏ qua nếu bạn chỉ cần các yêu cầu HTTP đơn giản, hoặc nếu stack của bạn đã có Playwright được bọc trong một lớp chống phát hiện tùy chỉnh.
What BrowserAct Offers for AI Agents
BrowserAct là một CLI cung cấp cho AI agent các phiên bản Chrome thực, có thể điều khiển với các lớp phòng thủ chống bot tích hợp. Nó phơi bày một bộ lệnh để mở trang, nhấp theo chỉ mục, nhập vào trường và trích xuất nội dung — được thiết kế để tối ưu hiệu quả đầu ra của LLM thay vì dễ đọc đối với con người. Các chế độ trình duyệt bao gồm tái sử dụng hồ sơ Chrome cục bộ, ẩn danh dấu vân tay mới cho cào dữ liệu theo lô không ma sát, và ẩn danh với định danh cố định cho công việc đa tài khoản đã đăng nhập. Hệ thống Skills cho phép agent khám phá các lệnh có sẵn và trạng thái trình duyệt chỉ trong một lần gọi.
Core Capabilities for Web Interaction
- ✓Ba chế độ trình duyệt: tái sử dụng hồ sơ Chrome cục bộ, ẩn danh dấu vân tay mới cho cào dữ liệu theo lô không ma sát, và ẩn danh với định danh cố định cùng IP ổn định cho các phiên đa tài khoản đã đăng nhập
- ✓Ba lớp chống bot: giả mạo môi trường (dấu vân tay + xoay TLS + proxy), giải CAPTCHA và trích xuất trang ẩn danh ở lớp thực thi, và chuyển giao cho người từ xa làm giải pháp cuối cùng
- ✓Đồng thời không can thiệp: cookie, dấu vân tay và proxy độc lập giữa các phiên song song để các trang web không thể tương quan chúng
- ✓Mô hình tương tác theo chỉ mục: `state` trả về danh sách phần tử được đánh chỉ mục; agent nhấp theo số (`click 3`) hoặc nhập theo chỉ mục (`input 2 "text"`) — không yêu cầu phân tích cú pháp DOM
- ✓Đầu ra văn bản nhỏ gọn: định dạng văn bản thuần túy được đánh chỉ mục thay vì HTML thô hoặc JSON dài dòng, giảm chi phí token trên mỗi trang
- ✓Hệ thống Skills để agent khám phá: `get-skills core` trả về trạng thái môi trường, các trình duyệt có sẵn và tham chiếu lệnh đầy đủ trong một lần gọi
- ✓Cổng xác nhận bảo mật: các thao tác nhạy cảm (tạo/xóa trình duyệt, nhập hồ sơ, thay đổi proxy) yêu cầu phê duyệt rõ ràng mỗi lần — được thực thi ở lớp Skill, không phải một công tắc cấu hình
- ✓Skill Forge và hơn 30 giải pháp dựng sẵn: tự động tạo ra các Skill cào dữ liệu có thể tái sử dụng bằng cách khám phá một trang web một lần, sau đó tái sử dụng đường dẫn ổn định để trích xuất khối lượng lớn
Getting Started with BrowserAct Skills
Hãy yêu cầu AI agent của bạn cài đặt BrowserAct bằng cách sử dụng nguồn Skill của nó: `https://github.com/browser-act/skills/tree/main/browser-act`. Agent chạy `get-skills core --skill-version 2.0.2` để khám phá trạng thái môi trường và các lệnh có sẵn. Cài đặt cục bộ yêu cầu Chrome (hoặc Chromium) trên Windows, macOS hoặc Linux; chế độ quản lý trên đám mây không yêu cầu thiết lập cục bộ nào. Sau khi cài đặt, hãy xác minh bằng một lệnh đơn giản như `browser-act --version` hoặc một lệnh `browser-act stealth-extract` cơ bản trên một URL đã biết.
Automating Tasks with BrowserAct Commands
Các lệnh BrowserAct tuân theo một mẫu dựa trên phiên: `browser-act --session <name> <command>`. Các lệnh cốt lõi bao gồm `browser open <id> <url>` để mở một trang, `state` để liệt kê các phần tử có thể nhấp theo chỉ mục, `click <n>` để tương tác theo số, `input <n> "text"` để nhập vào trường, và `stealth-extract <url>` cho nội dung được bảo vệ trên một trang mà không cần phiên đầy đủ. Đối với các tác vụ song song, hãy chạy nhiều phiên với các tên khác nhau — mỗi phiên sẽ có cookie, dấu vân tay và proxy độc lập. Lệnh `remote-assist` tạo ra một URL trực tiếp để người dùng tiếp quản khi agent bị kẹt. Người dùng Skill Forge mô tả dữ liệu họ cần và agent tạo ra một gói Skill có thể tái sử dụng mà agent có thể chạy theo yêu cầu.
Strengths
- ✓Được xây dựng có mục đích cho AI agent thay vì người dùng — đầu ra được đánh chỉ mục, quyền sở hữu phiên và bộ nhớ ngữ nghĩa phù hợp với cách LLM thực sự suy luận
- ✓Stack chống bot thực với các lớp tiến bộ: hầu hết các chặn không bao giờ kích hoạt, giải CAPTCHA xử lý những gì vượt qua, chuyển giao cho người bao gồm phần còn lại
- ✓Cô lập đa tài khoản hoạt động ngay lập tức — không yêu cầu xóa cookie thủ công hoặc quản lý hồ sơ
- ✓Gói miễn phí hào phóng: tự động hóa trình duyệt đầy đủ và các tính năng ẩn danh cơ bản mà không cần đăng ký
- ✓Skill Forge tự động tạo ra các Skill cào dữ liệu có thể tái sử dụng, giảm nhu cầu tự viết scraper cho từng trang web mục tiêu
- ✓Đa nền tảng: hoạt động trên Windows, macOS và Linux với bất kỳ agent nào có thể thực thi lệnh shell
Understanding BrowserAct's Free and Paid Features
- △Số lượng trình duyệt ẩn danh bị giới hạn ở 5 trên gói miễn phí; proxy được quản lý và các trình duyệt ẩn danh bổ sung yêu cầu tín dụng trả phí
- △Các trang web nặng JavaScript vẫn hoạt động tốt hơn ở chế độ hiển thị so với headless — một số quy trình làm việc cần có màn hình
- △Skill Forge và các tính năng tự động hóa nâng cao yêu cầu đăng nhập BrowserAct, không chỉ cài đặt CLI
- △Mô hình cài đặt dựa trên Skill giả định AI agent của bạn có thể tải các Skill bên ngoài — các agent không có khả năng đó cần thiết lập thủ công
- △Không có mô phỏng trình duyệt di động gốc cho các trang web phục vụ nội dung khác nhau cho user agent di động
- △Chất lượng tài liệu thay đổi; một số tính năng nâng cao (thiết lập proxy, tinh chỉnh dấu vân tay) được đề cập nhưng không được mô tả đầy đủ trong README
Other Tools for AI Agent Web Interaction
Frequently Asked Questions
Có. Gói miễn phí (không cần đăng ký) bao gồm tự động hóa trình duyệt và chế độ Chrome/Chrome-direct. Đăng nhập cho phép sử dụng trình duyệt ẩn danh tối đa 5 phiên, stealth-extract, solve-captcha, remote-assist, chế độ riêng tư và Skill Forge. Các tính năng trả phí bao gồm trình duyệt ẩn danh bổ sung và proxy được quản lý.
BrowserAct sử dụng ba lớp tiến bộ. Thứ nhất, giả mạo môi trường với dấu vân tay ẩn danh, xoay TLS và chuyển đổi proxy ngăn chặn hầu hết các chặn. Thứ hai, solve-captcha tự động giải CAPTCHA ở lớp thực thi. Thứ ba, remote-assist tạo ra một URL trực tiếp để người dùng tiếp quản khi tự động hóa không thể tiếp tục.
Có. Các phiên chạy với cookie, dấu vân tay và proxy độc lập, vì vậy các trang web không thể tương quan chúng. Bạn có thể chạy đa phiên cùng trình duyệt với trạng thái đăng nhập dùng chung, hoặc các phiên hoàn toàn cô lập cho các tài khoản khác nhau — không cần dọn dẹp thủ công giữa các tác vụ.
Bất kỳ agent nào có khả năng thực thi lệnh shell và tải Skills đều có thể sử dụng BrowserAct. README liệt kê cụ thể Claude Code, Cursor, VS Code, OpenCode, OpenClaw, Codex và Gemini CLI là tương thích.
Skill Forge khám phá một trang web mục tiêu một lần để khám phá cấu trúc và mẫu dữ liệu của nó, sau đó tạo ra một gói Skill sẵn sàng triển khai chạy đáng tin cậy trên các yêu cầu tiếp theo mà không cần khám phá lại. Nó được cung cấp miễn phí khi đăng nhập BrowserAct và cung cấp năng lượng cho hơn 30 giải pháp dựng sẵn bao gồm Amazon, Google Maps, YouTube, Reddit, v.v.
The problem it solves
Các công cụ tự động hóa trình duyệt tiêu chuẩn được xây dựng cho người dùng, không phải cho AI agent cần đầu ra nhỏ gọn, tương tác theo chỉ mục và không nhiễm chéo giữa các tác vụ song song. Hầu hết các scraper thất bại ở các trang web sử dụng fingerprinting hoặc cổng CAPTCHA, và các trình duyệt headless hiện có bị gắn cờ là bot ngay khi truy cập bất kỳ trang web phức tạp nào. Các agent cũng cần một đường dẫn chuyển giao rõ ràng khi gặp phải thứ chúng không thể tự giải quyết.
Best use cases
- •Trích xuất dữ liệu web từ các trang web có bảo vệ chống bot, bao gồm các trang yêu cầu xác thực đăng nhập
- •Cào dữ liệu hoặc tự động hóa song song trên nhiều tài khoản độc lập mà không nhiễm chéo
- •Quy trình làm việc của AI agent cần tương tác trình duyệt thực thay vì gọi API — cho các trang không có API công khai hoặc có các endpoint bị giới hạn tốc độ
- •Chạy các công việc cào dữ liệu lặp lại ở quy mô lớn thông qua các Skill được tạo bởi Skill Forge mà không cần viết mã scraper tùy chỉnh
- •Các kịch bản chuyển giao giữa người và agent, nơi AI xử lý các bước thường lệ và chuyển giao cho người khi gặp CAPTCHA hoặc cảnh báo tài khoản
- •Thu thập dữ liệu theo lô từ các nền tảng thương mại điện tử, mạng xã hội hoặc việc làm sử dụng các Skill dựng sẵn hoặc tùy chỉnh
Who should try it — and who should skip
Hãy thử BrowserAct nếu bạn đang xây dựng các quy trình làm việc của AI agent cần tương tác với web trực tiếp — cào các trang yêu cầu xác thực, tự động hóa các tác vụ liên quan đến tài khoản hoặc trích xuất dữ liệu từ các trang web chủ động chống lại việc cào dữ liệu. Nó đặc biệt hữu ích khi các agent cần làm việc song song mà không nhiễm chéo, hoặc khi bạn muốn có một đường dẫn chuyển giao cho người để xử lý các trường hợp ngoại lệ. Hãy bỏ qua nếu các mục tiêu cào dữ liệu của bạn có API công khai rõ ràng, hoặc nếu bạn đã hài lòng với Playwright cộng với mã chống phát hiện tùy chỉnh — BrowserAct bổ sung giá trị lớn nhất khi khả năng chống bot và UX gốc agent quan trọng hơn tùy chỉnh thô.
Repo liên quan
Vẫn đang phân vân về skills?
Một cú bấm sẽ gửi câu hỏi kèm trang này cho AI — xem AI nói gì về skills.
