AgentBrowse: Браузинг в терминале для AI-помощника
agentbrowse: как заставить AI-агента работать с веб-интерфейсами
Бывает так: AI-ассистент отлично справляется с кодом, но стоит попросить его кликнуть пару кнопок в браузере — и начинается хаос.
Именно эту проблему решает agentbrowse. Это CLI-утилита, которая оборачивает Playwright в простой и понятный интерфейс для AI-агентов. Claude Code, Codex, Cursor — всё это проходит мимо, если не дать роботу правильные инструменты.
Почему веб-интерфейсы — боль для AI
Классическая автоматизация браузера заточена под людей. Человек интуитивно понимает, куда кликнуть, справляется с капчами и не паникует, если кнопка сдвинулась на пару пикселей.
AI-агенты — совсем другое дело. Они прекрасно выполняют чёткие команды, но визуальный интерфейс ставит их в тупик. agentbrowse переворачивает эту логику. Вместо того чтобы заставлять агента воевать с браузером, мы даём ему чистый API: открыл страницу, прочитал как markdown, кликнул по тексту или номеру ссылки, заполнил форму. Всё через терминальные команды, которые возвращают структурированные данные.
Быстрый старт
Установка элементарная:
npm install -g agentbrowse
npx playwright install chromium
Готово. При первом запуске Chromium скачается автоматически.
Базовый набор команд:
agentbrowse open <url>— открываем страницуagentbrowse read— получаем содержимое в виде markdownagentbrowse links— пронумерованные ссылки для переходаagentbrowse click "Регистрация"— клик по тексту или номеруagentbrowse read --json— структурированный вывод для программной обработки
Персистентные сессии — главная фишка
agentbrowse выделяется именно моделью постоянных сессий. Фоновый демон браузера работает непрерывно и сохраняет состояние страницы между командами. Зашёл на сайт, авторизовался, дошёл до нужного раздела — и передал управление агенту. Никакого пересоздания состояния каждый раз.
Сессии изолированы по ID, у каждой свои cookies и данные авторизации. Команда login даже открывает реальное окно браузера, чтобы вы могли вручную пройти MFA или капчу, а потом сохраняет эту авторизованную сессию для headless-использования.
Автоматическое распознавание агентом
Самое интересное — интеграция с AI-ассистентами. agentbrowse можно установить как «навык», который кодинг-агент распознаёт сам:
npx agentbrowse skill --global
Утилита сама пропишет нужный конфиг для вашего агента: SKILL.md для Claude Code, .cursor/rules для Cursor, AGENTS.md для Codex. Теперь AI-ассистент знает, что браузерная автоматизация доступна — без необходимости писать простыни инструкций в промптах.
Структурированный вывод для машин
Каждая команда поддерживает флаг --json для машинночитаемого результата. Ошибки имеют предсказуемый формат и конкретные коды завершения: 2 — ошибка использования, 3 — сбой навигации, 4 — цель не найдена, 5 — проблема с демоном. Это делает agentbrowse надёжным инструментом для CI/CD пайплайнов и автоматизированных сценариев.
Манифесты сайтов — domain-specific команды
Для сложных или часто используемых сайтов можно описать манифест с именованными высокоуровневыми командами:
agentbrowse --site ./github.agent.json create-issue "Баг в форме логина"
Манифесты объявляют страницы, селекторы и последовательности действий с подстановкой переменных. Фактически — кастомные навыки для конкретных сайтов.
Зачем это всё
agentbrowse — это смена парадигмы. Вместо попыток научить AI «видеть» как человек, мы даём агенту инструменты под его сильные стороны: чёткие команды, парсибельный вывод, сохраняемое состояние.
Для разработчиков, строящих agent-powered workflows, это практичный инструмент, закрывающий реальный пробел. Для тех, кто только изучает AI-assisted development, это намёк на будущее: программные интерфейсы вместо визуальных, созданных для машин, а не для людей.
Автоматизируете веб-тесты, строите AI-воркфлоу или просто любопытствуете — agentbrowse заслуживает внимания. MIT-лицензия, активная разработка, работает полностью локально без облачных зависимостей.
Терминал снова в деле. И теперь его может использовать даже ваш AI.