laion/r2egym_8b_rope_65k-step17

🤗 Hugging Face 来源text-generationapache-2.08.2B 参数16 GBsafetensors✓ 5 个校验和今天更新
一条命令提交

在你的模型文件夹旁边运行它。它会制作种子、将文件与 Hugging Face 比对,然后提交。你只需开始做种,并粘贴你账户中的密钥。它只读取你的文件,绝不修改。如果愿意,可以先阅读脚本。

curl -fsSL https://pirateface.co/package.sh | bash -s -- --repo laion/r2egym_8b_rope_65k-step17 ./model-folder
需要做种者 →

r2egym_8b_rope_65k-step17

RL-trained Qwen3-8B on R2EGym tasks (65k context with YaRN rope scaling, 17 steps).

Training Details

Parameter Value
Base model laion/GLM-4_7-r2egym_sandboxes-maxeps-131k-lc (Qwen3-8B SFT, long-context)
Dataset R2EGym GPT5/Codex solved tasks (1,785 tasks)
Algorithm RLOO-N (Leave-One-Out with neutral masking)
Learning rate 3.0e-5
Train batch size 32
Samples per prompt 8
Max episodes 64
Max generate length 8,192 tokens
Max input tokens 57,344
Max model length 65,536
Rope scaling YaRN (factor=4.0, original_max_pos_emb=32,768)
KL loss Disabled
Reward shaping Enabled (pass_ratio)
Staleness steps 16
Policy nodes 2 (8 GPUs, FSDP2)
Inference engines 20 (TP=1)
Training steps 17
Framework BenSkyRL + Harbor

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("laion/r2egym_8b_rope_65k-step17")
tokenizer = AutoTokenizer.from_pretrained("laion/r2egym_8b_rope_65k-step17")