#fine-grained-reward

1 записей

Универсальный фреймворк LLM-as-a-Verifier для точной оценки и ранжирования траекторий агентов с использованием мелкозернистых логпроб-скоров и Probabilistic Pivot Tournament.

источник ↗