RL-Forgetting-Experiments-3/code-llama3p2_3b-replay-lam0p1 Reinforcement Learning • Updated 6 days ago
RL-Forgetting-Experiments-3/qwen2.5-3b-kk-sft-replay-uniform-lam1-step2222 3B • Updated 15 days ago • 22
RL-Forgetting-Experiments-3/qwen3-1.7b-base-code-sft-ordered-lr1e5-step102 Text Generation • 2B • Updated 15 days ago • 794
RL-Forgetting-Experiments-3/qwen3-1.7b-base-code-sft-ordered-lr1e5-step102 Text Generation • 2B • Updated 15 days ago • 794
RL-Forgetting-Experiments-3/qwen3-1.7b-base-code-sft-shuffled-lr1e5-step102 Text Generation • 2B • Updated 16 days ago • 788
RL-Forgetting-Experiments-3/qwen3-1.7b-base-code-sft-shuffled-lr1e5-step102 Text Generation • 2B • Updated 16 days ago • 788