Announcement
LongHarness introduced as a benchmark for long-context harnesses
The original post describes LongHarness as a challenging evaluation for systems such as RLMs and coding agents.
TLDR
A post introducing LongHarness shares a new paper on evaluating long-context harnesses, including RLMs and coding agents. It describes LongHarness as a challenging benchmark for that work.
Combined views
3.5K
2 Sources, first seen 14h ago
54 likes
