Agentbrowse: Terminalgrensesnittet AI-koderen din har ventet på
Slik får du AI-assistentene til å surfe på nettet
La meg være direkte: AI-kodere er fantastiske når de jobber med kommandolinjer og kodefiler, men be dem navigere gjennom et webgrensesnitt og ting blir fort rotete.
Det er gapet agentbrowse fyller. Verktøyet pakker Playwright inn i et enkelt, agentvennlig grensesnitt — et som snakker språket til AI-kodere som Claude Code, Codex, Cursor og lignende.
Utfordringen med nettlesere og AI-agenter
Tradisjonell nettleserautomatisering forutsetter at et menneske styrer. Mennesker kan håndtere CAPTCHAs, tolke visuelle oppsett intuitivt, og klikke presist på den lille knappen. AI-agenter? Ikke like enkelt. De utfører gjerne presise kommandoer, men sliter med tvetydigheten i visuelle grensesnitt.
agentbrowse snur denne relasjonen. I stedet for at en agent kjemper med en nettleser, får den en ren API: åpne en URL, les siden som markdown, klikk på tekst eller nummer, fyll ut skjemaer — alt gjennom terminalkommandoer som returnerer strukturert data.
Kom i gang på minutter
Installasjonen er rett frem:
npm install -g agentbrowse
npx playwright install chromium
Det er alt. Første kjøring laster ned Chromium automatisk, og du er klar.
Arbeidsflyten er overraskende enkel:
agentbrowse open <url>— naviger til en sideagentbrowse read— få siden som ren, token-begrenset markdownagentbrowse links— se nummererte, klikkbare lenkeragentbrowse click "Registrer deg"— klikk basert på synlig tekst eller lenkenummeragentbrowse read --json— strukturert output for programmer
Vedvarende økter: Hemmeligheten
Det som gjør agentbrowse skikkelig nyttig er den vedvarende øktmodellen. En bakgrunnsnettleser kjører kontinuerlig og holder sidetilstanden levende mellom kommandoer. Det betyr at du kan åpne et nettsted, logge inn, navigere til en spesifikk side, og deretter overlate til din agent — uten å bygge opp tilstand på nytt hver gang.
Øktene er isolerte med egne informasjonskapsler og autentiseringstilstand. login-kommandoen åpner til og med en ekte nettleser for at du skal kunne håndtere MFA og CAPTCHAs, og lagrer deretter den autentiserte økten for hodeløs gjenbruk.
Få agenten til å bruke det automatisk
Her blir det smart. Du kan installere agentbrowse som en "ferdighet" som kodagenten din gjenkjenner automatisk:
npx agentbrowse skill --global
Dette skriver riktig konfigurasjonsfil for agenten du bruker — SKILL.md for Claude Code, .cursor/rules for Cursor, AGENTS.md for Codex — slik at AI-assistenten vet når den skal ty til nettleserautomatisering.
Ingen flere kompliserte instruksjoner om hvordan bruke en nettleser. Funksjonaliteten er rett og slett... der.
Strukturert output for maskiner
Alle kommandoer støtter --json for maskinlesbar output, og feil følger et konsekvent format med spesifikke exitkoder (2 for bruksfeil, 3 for navigasjonsfeil, 4 for mål ikke funnet, 5 for daemon-problemer). Dette gjør agentbrowse skriptbar og pålitelig for CI/CD-pipelines og automatiserte arbeidsflyter.
Nettstedsmanifester: Domènespesifikk kraft
For komplekse eller ofte brukte nettsteder kan du definere et manifest som eksponerer navngitte, høynivå-kommandoer:
agentbrowse --site ./github.agent.json create-issue "Feil i innloggingsflyten"
Manifester erklærer sider, velgere og kommandosekvenser med variabelinterpolasjon — altså egendefinerte "ferdigheter" for spesifikke nettsteder.
Det større bildet
agentbrowse representerer et skifte i hvordan vi tenker om AI-agenters muligheter. I stedet for å håpe at AI-synsmodeller kan tilnærme seg menneskelig-nettleser-interaksjon, gir vi agentene verktøy designet for deres styrker: strukturerte kommandoer, parsebar output og vedvarende tilstand.
For utviklere som bygger agentdrevne arbeidsflyter er dette et praktisk verktøy som fyller et reelt behov. For de som utforsker AI-assistert utvikling, er det et glimt av hvordan agent-verktøy-interaksjoner kan utvikle seg — bort fra visuelle grensesnitt designet for mennesker, mot programmerbare grensesnitt designet for maskiner.
Enten du automatiserer webtesting, bygger AI-arbeidsflyter, eller bare er nysgjerrig på fremtiden for agent-verktøy-interaksjon, er agentbrowse verdt å utforske. Det er MIT-lisensiert, aktivt vedlikeholdt, og kjører fullstendig lokalt — ingen skytjenester eller eksterne avhengigheter.
Terminalen er tilbake, og nå kan til og med AI-en din bruke den.