The models for the paper: Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts
Yingfa Chen
chen-yingfa
AI & ML interests
Long-context modeling, continual learning, architectures
Organizations
None yet