07:00:09
Lock acquired for command: linksite:jp-bench-watch
07:00:10
[2026-07-10T07:00:09+00:00] JP bench 2/51 scored (3.9%) · missing 49
orchestrator: not detected
next cell: jp-1 × moonshotai/kimi-k2.6
gaps (62):
· [medium] jp-1: missing 4 challenger(s): moonshotai/kimi-k2.6, fugu-ultra, anthropic/claude-sonnet-5…
· [info] jp-1: A/B comparison ready (2 challengers + baseline)
· [high] jp-2: missing 5 challenger(s): deepseek/deepseek-v3.2, moonshotai/kimi-k2.6, fugu-ultra…
· [high] jp-3: missing 5 challenger(s): deepseek/deepseek-v3.2, moonshotai/kimi-k2.6, fugu-ultra…
· [high] jp-4: missing 5 challenger(s): deepseek/deepseek-v3.2, moonshotai/kimi-k2.6, fugu-ultra…
· [high] jp-5: missing 5 challenger(s): deepseek/deepseek-v3.2, moonshotai/kimi-k2.6, fugu-ultra…
· … +56 more (see gaps report file)
improvements (4):
· [high] 105 linksite eval/finalize failed_jobs in 24h — inspect failed_jobs table
· [medium] evaluator.all_axes_failed ×1 in recent logs — All eval axes failed — check model routing / API keys
· [info] finalize_generation.skip_auto_eval_bench ×1 in recent logs — Bench double-eval prevented (expected on is_bench_run)
· [info] clobbering_inflight ×1 in recent logs — Eval dispatch clobbered an in-flight run — run docs should isolate, verify aggregator
07:00:10
Lock released for linksite:jp-bench-watch