agentbrowse – to właśnie tego potrzebuje Twój AI coding agent

agentbrowse – to właśnie tego potrzebuje Twój AI coding agent

Cze 21, 2026 ai tools developer productivity browser automation npm packages claude code playwright terminal tools ai coding agents workflow automation

agentbrowse — kiedy Twój AI potrzebuje przeglądarki

Każdy, kto pracował z AI coding agents wie, jak świetnie radzą sobie z plikami tekstowymi i liniami poleceń. Ale wystarczy poprosić je o klikanie po stronie internetowej, a robi się... kłopotliwie.

Tu wkracza agentbrowse.

Problem, który wszyscy znamy

Tradycyjna automatyzacja przeglądarek zakłada, że za sterami siedzi człowiek. Człowiek rozumie układ strony, wie gdzie kliknąć, radzi sobie z CAPTCHA i MFA. AI? Nie bardzo. Agent doskonale wykonuje precyzyjne polecenia, ale grzęźnie w niejednoznaczności interfejsów graficznych.

agentbrowse odwraca tę relację. Zamiast zmuszać agenta do walki z przeglądarką, dostaje on czyste API: otwórz stronę, przeczytaj ją jako markdown, kliknij w tekst lub numer, wypełnij formularz — wszystko przez komendy terminalowe zwracające uporządkowane dane.

Instalacja — dosłownie dwie linie

npm install -g agentbrowse
npx playwright install chromium

Przy pierwszym uruchomieniu Chromium pobiera się automatycznie. Koniec.

Podstawowe komendy wyglądają tak:

  • agentbrowse open <url> — idź pod wskazany adres
  • agentbrowse read — zwróć stronę jako czysty markdown
  • agentbrowse links — lista ponumerowanych linków
  • agentbrowse click "Zarejestruj się" — kliknij w tekst lub numer linku
  • agentbrowse read --json — wyjście strukturalne dla programów

Proste, prawda?

Sesje — to wyróżnia ten projekt

Najciekawsze jest to, jak agentbrowse zarządza stanem. Zamiast uruchamiać przeglądarkę za każdym razem od nowa,守护进程 (daemon) chodzi w tle i utrzymuje aktywną sesję. Otwierasz stronę, logujesz się, przechodzisz do konkretnego widoku — i przekazujesz to agentowi bez konieczności odbudowywania całego stanu.

Każda sesja ma własny ID, ciasteczka i stan autoryzacji. Komenda login otwiera prawdziwe okno przeglądarki, żebyś mógł obsłużyć MFA czy CAPTCHA, a potem zapisuje tę autoryzowaną sesję do późniejszego użycia.

Automatyczne rozpoznawanie przez agenta

Kto by pomyślał — możesz zainstalować agentbrowse jako "skill":

npx agentbrowse skill --global

To pisze odpowiedni plik konfiguracyjny dla Twojego agenta — SKILL.md dla Claude Code, .cursor/rules dla Cursor, AGENTS.md dla Codex. Od teraz AI sam wie, że może sięgnąć po automatyzację przeglądarki, gdy zajdzie taka potrzeba.

Żadnych rozbudowanych promptów tłumaczących, jak obsługiwać web. Po prostu działa.

Wyjście JSON dla maszyn

Każda komenda przyjmuje flagę --json, a błędy mają ustalone kody wyjścia:

  • 2 — błąd użycia
  • 3 — problem z nawigacją
  • 4 — element nie znaleziony
  • 5 — problem z daemonem

To sprawia, że agentbrowse świetnie sprawdza się w CI/CD i automatycznych pipeline'ach.

Site manifests — własne komendy dla konkretnych stron

Dla stron, z których korzystasz często, możesz zdefiniować plik manifestu z nazwanymi, wysokopoziomowymi komendami:

agentbrowse --site ./github.agent.json create-issue "Bug w procesie logowania"

Manifesty opisują strony, selektory i sekwencje poleceń z interpolacją zmiennych. Własne "umiejętności" dla konkretnych domen.

Szerszy kontekst

agentbrowse to sygnał, że coś się zmienia w myśleniu o możliwościach AI agents. Zamiast liczyć, że modele wizyjne dorównają człowiekowi w obsłudze przeglądarki, dajemy im narzędzia dopasowane do ich natury: strukturalne komendy, czytelne wyjście, trwały stan.

Dla deweloperów budujących workflow oparte na agentach to praktyczne rozwiązanie realnego problemu. Dla wszystkich zainteresowanych przyszłością programowania z AI — to podgląd tego, jak mogą wyglądać interakcje agent-narzędzie: mniej interfejsów zaprojektowanych dla ludzi, więcej API zaprojektowanych dla maszyn.

Niezależnie od tego, czy automatyzujesz testy webowe, budujesz workflow oparte na AI, czy po prostu jesteś ciekaw, co przyniesie przyszłość — agentbrowse zasługuje na Twoją uwagę. MIT license, aktywny rozwój, działa całkowicie lokalnie. Żadnych zależności od chmury.

Terminal wraca do łask — i teraz nawet Twój AI może z niego korzystać.

Read in other languages:

RU BG EL CS UZ TR SV FI RO PT NB NL HU IT FR ES DE DA ZH-HANS EN