AgentBrowse: Браузинг в терминале для AI-помощника

AgentBrowse: Браузинг в терминале для AI-помощника

Июн 21, 2026 ai tools developer productivity browser automation npm packages claude code playwright terminal tools ai coding agents workflow automation

agentbrowse: как заставить AI-агента работать с веб-интерфейсами

Бывает так: AI-ассистент отлично справляется с кодом, но стоит попросить его кликнуть пару кнопок в браузере — и начинается хаос.

Именно эту проблему решает agentbrowse. Это CLI-утилита, которая оборачивает Playwright в простой и понятный интерфейс для AI-агентов. Claude Code, Codex, Cursor — всё это проходит мимо, если не дать роботу правильные инструменты.

Почему веб-интерфейсы — боль для AI

Классическая автоматизация браузера заточена под людей. Человек интуитивно понимает, куда кликнуть, справляется с капчами и не паникует, если кнопка сдвинулась на пару пикселей.

AI-агенты — совсем другое дело. Они прекрасно выполняют чёткие команды, но визуальный интерфейс ставит их в тупик. agentbrowse переворачивает эту логику. Вместо того чтобы заставлять агента воевать с браузером, мы даём ему чистый API: открыл страницу, прочитал как markdown, кликнул по тексту или номеру ссылки, заполнил форму. Всё через терминальные команды, которые возвращают структурированные данные.

Быстрый старт

Установка элементарная:

npm install -g agentbrowse
npx playwright install chromium

Готово. При первом запуске Chromium скачается автоматически.

Базовый набор команд:

  • agentbrowse open <url> — открываем страницу
  • agentbrowse read — получаем содержимое в виде markdown
  • agentbrowse links — пронумерованные ссылки для перехода
  • agentbrowse click "Регистрация" — клик по тексту или номеру
  • agentbrowse read --json — структурированный вывод для программной обработки

Персистентные сессии — главная фишка

agentbrowse выделяется именно моделью постоянных сессий. Фоновый демон браузера работает непрерывно и сохраняет состояние страницы между командами. Зашёл на сайт, авторизовался, дошёл до нужного раздела — и передал управление агенту. Никакого пересоздания состояния каждый раз.

Сессии изолированы по ID, у каждой свои cookies и данные авторизации. Команда login даже открывает реальное окно браузера, чтобы вы могли вручную пройти MFA или капчу, а потом сохраняет эту авторизованную сессию для headless-использования.

Автоматическое распознавание агентом

Самое интересное — интеграция с AI-ассистентами. agentbrowse можно установить как «навык», который кодинг-агент распознаёт сам:

npx agentbrowse skill --global

Утилита сама пропишет нужный конфиг для вашего агента: SKILL.md для Claude Code, .cursor/rules для Cursor, AGENTS.md для Codex. Теперь AI-ассистент знает, что браузерная автоматизация доступна — без необходимости писать простыни инструкций в промптах.

Структурированный вывод для машин

Каждая команда поддерживает флаг --json для машинночитаемого результата. Ошибки имеют предсказуемый формат и конкретные коды завершения: 2 — ошибка использования, 3 — сбой навигации, 4 — цель не найдена, 5 — проблема с демоном. Это делает agentbrowse надёжным инструментом для CI/CD пайплайнов и автоматизированных сценариев.

Манифесты сайтов — domain-specific команды

Для сложных или часто используемых сайтов можно описать манифест с именованными высокоуровневыми командами:

agentbrowse --site ./github.agent.json create-issue "Баг в форме логина"

Манифесты объявляют страницы, селекторы и последовательности действий с подстановкой переменных. Фактически — кастомные навыки для конкретных сайтов.

Зачем это всё

agentbrowse — это смена парадигмы. Вместо попыток научить AI «видеть» как человек, мы даём агенту инструменты под его сильные стороны: чёткие команды, парсибельный вывод, сохраняемое состояние.

Для разработчиков, строящих agent-powered workflows, это практичный инструмент, закрывающий реальный пробел. Для тех, кто только изучает AI-assisted development, это намёк на будущее: программные интерфейсы вместо визуальных, созданных для машин, а не для людей.

Автоматизируете веб-тесты, строите AI-воркфлоу или просто любопытствуете — agentbrowse заслуживает внимания. MIT-лицензия, активная разработка, работает полностью локально без облачных зависимостей.

Терминал снова в деле. И теперь его может использовать даже ваш AI.

Read in other languages:

BG EL CS UZ TR SV FI RO PT PL NB NL HU IT FR ES DE DA ZH-HANS EN