Announcement
E2S finetuning's claimed gains over two training baselines on new tasks
Its creator says E2S uses GFlowNets to turn expert demonstrations into training data better aligned with a student model.
TLDR
The developer describes E2S as a way to generate supervised fine-tuning examples that preserve information from expert demonstrations while better matching how a student model responds. They report gains of 6.0 points over MCMC+SFT and 35.2 points over vanilla expert SFT on new tasks, while preserving performance on prior tasks.
Combined views
950
2 Sources, first seen ago
