Agentbrowse: A terminál, amire az AI kódoló asszisztensek eddig vártak

Agentbrowse: A terminál, amire az AI kódoló asszisztensek eddig vártak

Jún 19, 2026 ai tools developer productivity browser automation npm packages claude code playwright terminal tools ai coding agents workflow automation

Az AI kódolási asszisztensek eddig nem tudták kezelni a webes felületeket — most már igen

Ha mostanában szórakoztál AI kódolási asszisztensekkel, biztosan észrevetted: parancssorban és kódfájlokban elképesztően ügyesek, de amint egy webes felületen kell navigálniuk, minden összezavarodik.

Itt jön képbe az agentbrowse.

Ez egy CLI eszköz, amely a Playwright-et burkolja egy egyszerű, agent-barát felületbe. Olyan módon kommunikál, amit az AI asszisztensek — legyen szó Claude Code-ról, Codexról vagy Cursorról — könnyedén megértenek.

A probléma: webes felületek és AI ügynökök

A hagyományos böngésző-automatizálás emberi felhasználóra van tervezve. Az emberek kezelik a CAPTCHÁ-t, intuícióval értelmezik a vizuális elrendezést, és pontosan oda kattintanak, ahova kell. Az AI ügynökök viszont küzdenek a vizuális felületek bizonytalanságával.

Az agentbrowse megfordítja ezt a kapcsolatot. Az ügynök nem a böngészővel küzd, hanem egy tiszta API-t kap:

  • URL megnyitása
  • Oldal beolvasása markdown formátumban
  • Kattintás szöveg vagy szám alapján
  • Űrlapok kitöltése

Mindez parancssorból, strukturált adatokkal visszatérve.

Elkezdeni pár perc alatt

A telepítés gyerekjáték:

npm install -g agentbrowse
npx playwright install chromium

Készen állsz. Az első futtatás automatikusan letölti a Chromiumot.

A használat alapjai:

  • agentbrowse open <url> — oldal megnyitása
  • agentbrowse read — aktuális oldal tiszta markdownként
  • agentbrowse links — számozott, követhető linkek listája
  • agentbrowse click "Sign up" — kattintás látható szöveg vagy link-szám alapján
  • agentbrowse read --json — strukturált kimenet programozott feldolgozáshoz

Persistence: a titkos összetevő

Amit az agentbrowse igazán hasznossá tesz, az a perzisztens munkamenet-modell. Egy háttérben futó böngésző daemon folyamatosan életben tartja az oldal állapotát a parancsok között.

Ez azt jelenti, hogy megnyithatod az oldalt, bejelentkezhetsz, navigálhatsz egy konkrét oldalra, majd átadhatod az irányítást az agentnek — mindezt állapot újraépítése nélkül.

A munkamenetek izoláltak, saját sütikkel és hitelesítési állapottal. A login parancs még egy valódi böngészőablakot is megnyit, ahol kezelheted az MFA-t és CAPTCHA-t, majd elmenti azt a hitelesített munkamenetet későbbi headless használatra.

Automatikus felismerés az agent által

Itt válik igazán elegánssá a dolog. Telepítheted az agentbrowse-t "skill"-ként, amit az AI kódolási asszisztensed automatikusan felismer:

npx agentbrowse skill --global

Ez megírja a megfelelő konfigurációs fájlt bármelyik agenthez — legyen az SKILL.md a Claude Code-hoz, .cursor/rules a Cursorhoz, vagy AGENTS.md a Codexhez.

Nincs többé szükség bonyolult promptokra, amelyek elmagyarázzák a böngésző használatát. A képesség egyszerűen... ott van.

Strukturált kimenet gépi feldolgozáshoz

Minden parancs fogadja a --json flaget gépileg olvasható kimenethez. A hibák konzisztens formátumot követnek, meghatározott kilépési kódokkal:

  • 2: használati hiba
  • 3: navigációs hiba
  • 4: cél nem található
  • 5: daemon probléma

Ez teszi az agentbrowse-t scriptelhetővé és megbízhatóvá CI/CD pipeline-okhoz és automatizált munkafolyamatokhoz.

Site manifestek: domain-specifikus szuperképességek

Komplex vagy gyakran használt oldalakhoz definiálhatsz site manifest fájlt, amely névvel ellátott, magas szintű parancsokat tesz elérhetővé:

agentbrowse --site ./github.agent.json create-issue "Bug in login flow"

A manifestek oldalakat, selectorokat és parancsszekvenciákat deklarálnak változó interpolációval — lényegében egyedi "skill"-eket hozol létre konkrét weboldalakhoz.

A nagyobb kép

Az agentbrowse egy eltolódást képvisel abban, ahogy az AI agent képességeit gondoljuk. Ahelyett, hogy reménykednénk, az AI látási modelljei reprodukálják az ember-böngésző interakciót, inkább eszközöket adunk az ügynököknek, amelyek az erejükre vannak tervezve: strukturált parancsok, elemezhető kimenet, perzisztens állapot.

Fejlesztőknek, akik agent-alapú munkafolyamatokat építenek, ez egy gyakorlatias eszköz, amely valós űrt tölt be. Azoknak, akik az AI-asszisztált fejlesztést térképezik fel, ez egy előfutárja annak, hogyan alakulhatnak az agent-eszköz interakciók — elszakadva a vizuális felületektől, amelyek embereknek lettek tervezve, a programozható felületek felé, amelyek gépeknek készültek.

Akár webes tesztelést automatizálsz, akár AI munkafolyamatokat építesz, akár csak kíváncsi vagy az agent-eszköz interakciók jövőjére — az agentbrowse megéri a felfedezést. MIT licenc alatt áll, aktívan fejlesztik, és teljesen lokálisan fut — nincs szükség felhőszolgáltatásokra vagy külső rendszerekre.

A terminál visszatért — és most már a te AI-d is használhatja.

Read in other languages:

RU BG EL CS UZ TR SV FI RO PT PL NB NL IT FR ES DE DA ZH-HANS EN