Webwright: терминал для браузерных агентов
Webwright превращает LLM в браузерного агента через терминал, где модель пишет и запускает Python-скрипты с Playwright вместо пошаговых действий в браузере.
privacy
Эта заметка участвует в semantic memory.
AI Summary
-
Короткий обзор сути: Webwright — минималистичный фреймворк, где LLM получает терминал и пишет полноценные Python-скрипты для управления браузером через Playwright вместо пошагового предсказания кликов и координат.
-
Ключевые тезисы: браузер запускается и уничтожается по необходимости, состояние хранится в коде и логах, а не в сессии; сложные задачи решаются через циклы, функции и параметризованные скрипты; подход даёт 86.7% на Online-Mind2Web (GPT-5.4) и 60.1% на Odysseys (200 задач, +15.6 п.п. над SOTA).
-
Важные детали и нюансы: ядро агента — ~450 строк, среда Playwright — ~570 строк; поддерживаются OpenAI, Anthropic, OpenRouter; плагины для Claude Code, Codex, OpenClaw, Hermes; Task2UI режим (2026-05-11) рендерит результат в HTML; report.json генерируется только при подключении task_showcase.yaml; все артефакты (траектории, скриншоты) сохраняются на диск.
-
Практические выводы и шаги: установить через pip install -e . && playwright install chromium; запуск: python -m webwright.run.cli -c base.yaml -c model_openai.yaml -t "текст задачи"; для Claude Code — /plugin install webwright@webwright и команды /webwright:run или /webwright:craft; для повторяемых задач использовать Task Showcase дашборд; цитировать репозиторий при использовании в исследованиях.