Report
Smarter models appeared to write better AI evals; higher effort helped with evals for small models
A user testing LLM judges says more compute yielded better checks, though their answer was βyes, kind of.β
TLDR
A user experimenting with automated evals and LLM judges said smarter models wrote better evals. Higher effort also led to better evals for small models like Luna, they said. Their answer to whether more compute improves checks was βyes, kind of.β
Combined views
1.5K
2 Sources, first seen ago
