989 environments reportedly used to train a distilled 9B model
A user who examined the release says reward scoring isn't self-contained: general environments need a judge set up, while web-development environments rely on a grader service and a vision-language model.
TLDR
A user who examined the release says it contains a smaller selection of 989 environments used for reinforcement learning on a distilled 9B model, not the big MiMo. They say general environments require setting up a judge, while web-development environments depend on the release's own grader service and a vision-language model. They highlight the general/envs directory, along with Docker—not the dataset displayed on Hugging Face—as the most important part, praising its mix of real and simulated documents as something rarely seen in open source.
989 environments reportedly used to train a distilled 9B model
A user who examined the release says reward scoring isn't self-contained: general environments need a judge set up, while web-development environments rely on a grader service and a vision-language model.
