Overview Search API Bench

источник ↗ ·

Сравнительный бенчмарк, оценивающий качество различных поисковых API в агентной парадигме с фиксированной моделью-ответчиком.

privacy

Эта заметка участвует в semantic memory.

AI Summary

  1. Короткий обзор сути: Overview Search API Bench — это провайдер-своп сравнение, где для каждого образца используется одна и та же модель-ответчик (GPT-5.6 Luna medium) и задача, а меняется только поисковый провайдер; итоговый Artificial Analysis Search Index — это равновзвешенное среднее трёх метрик качества. 🔑 Ключевые факты: три бенчмарка (DeepSearchQA 900 задач, AA-Omniscience 600 задач, BrowseComp 200 задач) используют единые константы (turn budget 25, max_results=10, temperature 0.6, max output tokens 127 999); модель имеет доступ к инструментам web_search и web_fetch; ошибки делятся на recoverable (возвращаются модели) и fatal (повторяются до успеха); применяется contamination filtering по URL, заголовку, сниппету и тексту страницы. 📌 Важные детали: модель_only baseline показывает, сколько задач решается без поиска; latency измеряется отдельно по model time, search time и time per query; стоимость разбивается на cost модели и cost поискового API; AA-Omniscience использует accuracy вместо Omniscience Index, потому что при наличии поиска модель склонна всегда отвечать. 💡 Вывод и значение: при выборе провайдера нужно сравнивать uplift качества, прирост стоимости и latency относительно baseline; сильный провайдер для конкретного сценария не обязательно лидер по общему индексу.

Мои мысли

graph

Карта связей