Report
Past experiment records reportedly improve an LLM's predictions of research outcomes
A post on an Amazon paper says same-setup records raised average ranking correlation from 0.506 to 0.774 across five setups.
TLDR
A post describing an Amazon paper says an LLM was tested on 2,653 experiment records across nine setups, from pretraining to inference. Past records from the same setup reportedly raised average ranking correlation with actual results from 0.506 to 0.774 across five setups. On OLMo3-100M, adding records at low reasoning effort scored 0.892, versus 0.648 at maximum effort without records. The author recommends logging failures, too, to help choose future experiments.
Combined views
—
1 Source, first seen ago
— likes— comments— saves— reposts
