FINDING #2750 · UNIT ID 1213526705
SeraphimSerapis/tool-eval-bench
Tool-calling quality benchmark for LLM serving stacks. 80+ deterministic scenarios testing multi-turn orchestration, safety boundaries, and structured output. Supports vLLM, SGLang, and llama.cpp.
SURPRISE SCORE
0.00
Score Breakdown
SCORE = SURPRISE × ENGAGEMENT^0.7 × FRESHNESS × VISIBILITY × CONFIDENCE
SURPRISE = WINDOW STARS / DAYS / (AUDIENCE + FLOOR)
17% OF STARS IN ARCHIVE
Growth Telemetry
VELOCITY /D
1.77
ACCEL
-0.07
RETENTION
12.1%
PEAK 2026-08-02 · FORK-RETENTION 100.0% · 53 STARS / WINDOW
Author Audience
AUDIENCE
192
FOLLOWERS
142
OWNER ★
498
Engagement Signals
FORKS
41
ISSUE AUTH
0
PR AUTH
0
UNIQUE STARGAZERS 53 / 53 (DIVERSITY 1.00)
Why This Is A Finding
SeraphimSerapis/tool-eval-bench собрал 53 звёзд за окно, тогда как у автора всего 142 подписчиков — эффективная аудитория ≈ 192. Это даёт surprise-индекс 0.00762 (звёзды относительно охвата автора, а не в абсолюте). Удержание форков 100.0% и 0 внешних контрибьюторов отделяют реальный инструмент от разовой вспышки. Акселерация отрицательная — внимание остывает после пика.
Related Findings
RANKS ABOVE 71% OF 9595 FINDINGS
METRICS IN CONTEXT
MEDIAN ACROSS ALL 9595 FINDINGS · Δ vs MEDIAN · PERCENTILE = SHARE RANKED BELOW
METRICVALUEMEDIANΔ MEDPERCENTILE
SCORE0.010.00+0.00ABOVE 71%
VELOCITY1.773.67-1.90ABOVE 11%
RETENTION12.1%24.6%-12.5 PPABOVE 26%
FORKS41115-74ABOVE 26%
SURPRISE0.010.01-0.00ABOVE 48%