LLM-as-a-Verifier: фреймворк верификации
Универсальный фреймворк LLM-as-a-Verifier для точной оценки и ранжирования траекторий агентов с использованием мелкозернистых логпроб-скоров и Probabilistic Pivot Tournament.
privacy
Эта заметка участвует в semantic memory.
AI Summary
- Короткий обзор сути: LLM-as-a-Verifier — это библиотека, которая превращает LLM в точный верификатор для любых агентных траекторий, используя мелкозернистые оценки по критериям, повторные прогоны и Probabilistic Pivot Tournament для выбора лучшего из N кандидатов.
🔑 Ключевые факты: SOTA на Terminal-Bench, SWE-Bench Verified, MedAgentBench и других; Best-of-5 даёт 88.0 % против Pass@1 78.7 %; O(Nk) сложность вместо O(N²); поддержка мультимодальности; prefix-cache оптимизация снижает uncached tokens в 3.4×.
📌 Важные детали: формула R(x,τ) = 1/(CK) Σ pθ(vg|x,c,τ)·ϕ(vg); ring-pass + pivot selection; 1-20 шкала (A-T в реализации); ProgressTracker для онлайн-мониторинга; token accounting через llm_verifier.USAGE; критерии хранятся в criteria/*.md; воспроизводимость через scripts/run.py и data/terminal_bench_2.1_trajs/.
💡 Вывод и значение: pip install llm_verifier; задать DEEPSEEK_API_KEY или VERTEX_API_KEY; python scripts/run.py terminal_bench; для нового бенчмарка скопировать data/task_trajs/ и запустить Claude Code с add_new_benchmark.md; использовать ProgressTracker.update(step, images=...) для онлайн-отслеживания.