Agentbrowse: A terminál, amire az AI kódoló asszisztensek eddig vártak
Az AI kódolási asszisztensek eddig nem tudták kezelni a webes felületeket — most már igen
Ha mostanában szórakoztál AI kódolási asszisztensekkel, biztosan észrevetted: parancssorban és kódfájlokban elképesztően ügyesek, de amint egy webes felületen kell navigálniuk, minden összezavarodik.
Itt jön képbe az agentbrowse.
Ez egy CLI eszköz, amely a Playwright-et burkolja egy egyszerű, agent-barát felületbe. Olyan módon kommunikál, amit az AI asszisztensek — legyen szó Claude Code-ról, Codexról vagy Cursorról — könnyedén megértenek.
A probléma: webes felületek és AI ügynökök
A hagyományos böngésző-automatizálás emberi felhasználóra van tervezve. Az emberek kezelik a CAPTCHÁ-t, intuícióval értelmezik a vizuális elrendezést, és pontosan oda kattintanak, ahova kell. Az AI ügynökök viszont küzdenek a vizuális felületek bizonytalanságával.
Az agentbrowse megfordítja ezt a kapcsolatot. Az ügynök nem a böngészővel küzd, hanem egy tiszta API-t kap:
- URL megnyitása
- Oldal beolvasása markdown formátumban
- Kattintás szöveg vagy szám alapján
- Űrlapok kitöltése
Mindez parancssorból, strukturált adatokkal visszatérve.
Elkezdeni pár perc alatt
A telepítés gyerekjáték:
npm install -g agentbrowse
npx playwright install chromium
Készen állsz. Az első futtatás automatikusan letölti a Chromiumot.
A használat alapjai:
agentbrowse open <url>— oldal megnyitásaagentbrowse read— aktuális oldal tiszta markdownkéntagentbrowse links— számozott, követhető linkek listájaagentbrowse click "Sign up"— kattintás látható szöveg vagy link-szám alapjánagentbrowse read --json— strukturált kimenet programozott feldolgozáshoz
Persistence: a titkos összetevő
Amit az agentbrowse igazán hasznossá tesz, az a perzisztens munkamenet-modell. Egy háttérben futó böngésző daemon folyamatosan életben tartja az oldal állapotát a parancsok között.
Ez azt jelenti, hogy megnyithatod az oldalt, bejelentkezhetsz, navigálhatsz egy konkrét oldalra, majd átadhatod az irányítást az agentnek — mindezt állapot újraépítése nélkül.
A munkamenetek izoláltak, saját sütikkel és hitelesítési állapottal. A login parancs még egy valódi böngészőablakot is megnyit, ahol kezelheted az MFA-t és CAPTCHA-t, majd elmenti azt a hitelesített munkamenetet későbbi headless használatra.
Automatikus felismerés az agent által
Itt válik igazán elegánssá a dolog. Telepítheted az agentbrowse-t "skill"-ként, amit az AI kódolási asszisztensed automatikusan felismer:
npx agentbrowse skill --global
Ez megírja a megfelelő konfigurációs fájlt bármelyik agenthez — legyen az SKILL.md a Claude Code-hoz, .cursor/rules a Cursorhoz, vagy AGENTS.md a Codexhez.
Nincs többé szükség bonyolult promptokra, amelyek elmagyarázzák a böngésző használatát. A képesség egyszerűen... ott van.
Strukturált kimenet gépi feldolgozáshoz
Minden parancs fogadja a --json flaget gépileg olvasható kimenethez. A hibák konzisztens formátumot követnek, meghatározott kilépési kódokkal:
- 2: használati hiba
- 3: navigációs hiba
- 4: cél nem található
- 5: daemon probléma
Ez teszi az agentbrowse-t scriptelhetővé és megbízhatóvá CI/CD pipeline-okhoz és automatizált munkafolyamatokhoz.
Site manifestek: domain-specifikus szuperképességek
Komplex vagy gyakran használt oldalakhoz definiálhatsz site manifest fájlt, amely névvel ellátott, magas szintű parancsokat tesz elérhetővé:
agentbrowse --site ./github.agent.json create-issue "Bug in login flow"
A manifestek oldalakat, selectorokat és parancsszekvenciákat deklarálnak változó interpolációval — lényegében egyedi "skill"-eket hozol létre konkrét weboldalakhoz.
A nagyobb kép
Az agentbrowse egy eltolódást képvisel abban, ahogy az AI agent képességeit gondoljuk. Ahelyett, hogy reménykednénk, az AI látási modelljei reprodukálják az ember-böngésző interakciót, inkább eszközöket adunk az ügynököknek, amelyek az erejükre vannak tervezve: strukturált parancsok, elemezhető kimenet, perzisztens állapot.
Fejlesztőknek, akik agent-alapú munkafolyamatokat építenek, ez egy gyakorlatias eszköz, amely valós űrt tölt be. Azoknak, akik az AI-asszisztált fejlesztést térképezik fel, ez egy előfutárja annak, hogyan alakulhatnak az agent-eszköz interakciók — elszakadva a vizuális felületektől, amelyek embereknek lettek tervezve, a programozható felületek felé, amelyek gépeknek készültek.
Akár webes tesztelést automatizálsz, akár AI munkafolyamatokat építesz, akár csak kíváncsi vagy az agent-eszköz interakciók jövőjére — az agentbrowse megéri a felfedezést. MIT licenc alatt áll, aktívan fejlesztik, és teljesen lokálisan fut — nincs szükség felhőszolgáltatásokra vagy külső rendszerekre.
A terminál visszatért — és most már a te AI-d is használhatja.