agentbrowse: Терминалният интерфейс, който AI код агентите чакаха
agentbrowse: Когато AI агентите се научат да сърфират в мрежата
Да си го кажем направо: AI агентите са страхотни, когато боравят с команди и файлове. Но като ги помолиш да щракнат някое копче в уеб интерфейс — нещата стават хаотични.
Точно тук идва agentbrowse. Това е CLI инструмент, който обвива Playwright в опростен интерфейс, създаден специално за AI асистенти като Claude Code, Codex, Cursor и компания.
Проблемът с уеб интерфейсите и AI агентите
Традиционната автоматизация на браузъри си представя човек на волана. Хората се справят с CAPTCHAs, интуитивно разчитат визуални оформления и натискат точно върху копчетата. AI агентите? Не толкова. Те са перфектни в изпълнението на точни команди, но се затрудняват с неяснотата на визуалните интерфейси.
agentbrowse обръща тази логика. Вместо агентът да се бори с браузъра, той получава чист API: отвори URL, прочете страницата като markdown, кликни по текст или номер, попълни формуляри — всичко това през терминални команди, които връщат структурирани данни.
Първи стъпки за минути
Инсталацията е детска игра:
npm install -g agentbrowse
npx playwright install chromium
И готово. При първото стартиране автоматично се изтегля Chromium и си готов да действаш.
Основният работен процес е изненадващо опростен:
agentbrowse open <url>— отваряне на страницаagentbrowse read— текущата страница като чист markdownagentbrowse links— номерирани линкове за последванеagentbrowse click "Регистрация"— кликване по видим текст или номер на линкagentbrowse read --json— структуриран изход за програми
Постоянните сесии: Тайната съставка
Това, което прави agentbrowse наистина полезен, е моделът на персистентни сесии. Фонов браузър демон работи непрекъснато и поддържа състоянието на страницата живо между командите. Отваряш сайт, логваш се, стигаш до конкретна страница, предаваш на агента — всичко това без да пресъздаваш състоянието всеки път.
Сесиите са изолирани по ID, всяка със собствени бисквитки и автентикационно състояние. Командата login дори отваря истински прозорец на браузъра, за да се справиш с MFA и CAPTCHAs, след което запазва тази автентикирана сесия за безглавно повторно използване.
Накарай агента си да го използва автоматично
Ето къде става интересно. Можеш да инсталираш agentbrowse като „умение", което AI асистентът ти разпознава автоматично:
npx agentbrowse skill --global
Това записва съответния конфигурационен файл за конкретния агент — SKILL.md за Claude Code, .cursor/rules за Cursor, AGENTS.md за Codex. Сега AI асистентът знае, че може да използва браузърна автоматизация, когато се наложи уеб взаимодействие.
Няма повече сложни инструкции как да ползва браузър. Възможността просто... съществува.
Структуриран изход за машини
Всяка команда поддържа --json за машинно-четим изход, а грешките следват консистентен формат със специфични кодове за изход (2 за грешки в употребата, 3 за навигационни проблеми, 4 за ненамерен елемент, 5 за демон проблеми). Това прави agentbrowse перфектен за скриптове и CI/CD пайпълйни.
Манифести на сайтове: Специфични суперсили
За сложни или често използвани сайтове можеш да дефинираш манифест файл, който експонира именувани високониваови команди:
agentbrowse --site ./github.agent.json create-issue "Бъг в логин потока"
Манифестите декларират страници, селектори и последователности от команди с променливи — създават се персонализирани „умения" за конкретни уебсайтове.
По-голямата картина
agentbrowse е част от промяна в мисленето ни за AI агентските възможности. Вместо да се надяваме AI моделите с компютърно зрение да имитират човешко взаимодействие с браузъра, даваме на агентите инструменти, съобразени с техните силни страни: структурирани команди, парсируем изход и постоянно състояние.
За разработчиците, които създават агентски работни процеси, това е практичен инструмент, който запълва реална празнина. За тези, които проучват AI-подпомогнатото разработване, това е поглед към бъдещето на взаимодействието агент-инструмент — насочено към програмни интерфейси, а не към визуални такива.
Дали автоматизираш уеб тестване, строиш AI работни процеси или просто си любопитен как се развива взаимодействието между агенти и инструменти — agentbrowse си струва да го разгледаш. Лицензът е MIT, проектът се поддържа активно и работи изцяло локално — без облачни зависимости или външни услуги.
Терминалът се завърна. И сега дори AI-то ти може да го използва.