PRIMESCIENTIST reportedly achieves higher average reward with fewer research attempts
A user reports 10.3% higher average reward than AutoResearch on 12 FIRE-Bench tasks, using 50.6% fewer research attempts under the same token budget.
TLDR
A user describes PRIMESCIENTIST as a research agent that keeps competing executable plans in a tree instead of following a single path. Experiment results update branch values, guiding broader exploration when resources are plentiful and a focus on stronger branches as the budget shrinks. The post reports 10.3% higher average reward than AutoResearch on 12 FIRE-Bench tasks, with 50.6% fewer research attempts under the same token budget. Across the full evaluation, it reportedly used fewer attempts on 23 of 24 tasks.
Combined views
3.1K
2 Sources, first seen 5h ago
