deepseek-ai/DeepSeek-V4-Flash-0731 Text Generation • 304B • Updated about 21 hours ago • 15.4k • • 1.42k
view article Article KV Caching Explained: Optimizing Transformer Inference Efficiency not-lain • Jan 30, 2025 • 385
FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning Paper • 2601.18150 • Published Jan 26 • 11
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning Paper • 2607.07508 • Published 25 days ago • 26