LLM-as-a-Verifier: фреймворк верификации

источник ↗ ·

Универсальный фреймворк LLM-as-a-Verifier для точной оценки и ранжирования траекторий агентов с использованием мелкозернистых логпроб-скоров и Probabilistic Pivot Tournament.

privacy

Эта заметка участвует в semantic memory.

AI Summary

  1. Короткий обзор сути: LLM-as-a-Verifier — это библиотека, которая превращает LLM в точный верификатор для любых агентных траекторий, используя мелкозернистые оценки по критериям, повторные прогоны и Probabilistic Pivot Tournament для выбора лучшего из N кандидатов.

🔑 Ключевые факты: SOTA на Terminal-Bench, SWE-Bench Verified, MedAgentBench и других; Best-of-5 даёт 88.0 % против Pass@1 78.7 %; O(Nk) сложность вместо O(N²); поддержка мультимодальности; prefix-cache оптимизация снижает uncached tokens в 3.4×.

📌 Важные детали: формула R(x,τ) = 1/(CK) Σ pθ(vg|x,c,τ)·ϕ(vg); ring-pass + pivot selection; 1-20 шкала (A-T в реализации); ProgressTracker для онлайн-мониторинга; token accounting через llm_verifier.USAGE; критерии хранятся в criteria/*.md; воспроизводимость через scripts/run.py и data/terminal_bench_2.1_trajs/.

💡 Вывод и значение: pip install llm_verifier; задать DEEPSEEK_API_KEY или VERTEX_API_KEY; python scripts/run.py terminal_bench; для нового бенчмарка скопировать data/task_trajs/ и запустить Claude Code с add_new_benchmark.md; использовать ProgressTracker.update(step, images=...) для онлайн-отслеживания.

Мои мысли

graph

Карта связей