view article Article ๐ RoPE (Rotary Position Embedding) โ When AI finally learns where it is! ๐โจ RDTvlokip โข Sep 30, 2025 โข 3
DFlash Collection Block Diffusion for Flash Speculative Decoding โข 23 items โข Updated Jun 28 โข 153
Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora Paper โข 2604.24819 โข Published Apr 27 โข 91
view post Post 1752 Interested in RL training environments?We just released a beginner-friendly walkthrough notebook!Train a model to play Wordle using TRL + OpenEnv (TextArena) + GRPO + vLLM.happy learning! ๐ฑNotebook: https://github.com/huggingface/trl/blob/main/examples/notebooks/openenv_wordle_grpo.ipynbOpenEnv guide in TRL: https://huggingface.co/docs/trl/main/en/openenv See translation ๐ 8 8 + Reply