Report
AI models may lose their place on long jobs, even within their context windows
A post about an Nvidia paper says seven open models had 62.8% lower average accuracy on 128K-token jobs than on 4K-token jobs.
TLDR
A post describing an Nvidia paper says seven open models struggled with long, repetitive tasks such as adding numbers and sorting lists. It reports that average accuracy was 62.8% lower on 128K-token jobs than on 4K-token jobs; even the best model got every item right in only 17.1% of the longest jobs. The post recommends numbering items, working in small batches and checking every output line.
Combined views
2.2K
1 Source, first seen ago
