LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training
Full-length song generation must preserve coherence and musicality, render detailed vocal and accompaniment acoustics, and follow lyrics and prompts. Existing language model-based systems face a structural trade-off: mixed-token modeling preserves vocal-instrument coordination but obscures track-specific details, whereas dual-track prediction improves acoustics but requires longer sequences and weakens global planning. We present LeVo 2, a hybrid LLM-Diffusion framework for controllable full-length song generation. LeVo 2 formulates this trade-off as hierarchical modeling: LeLM first predicts
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- FuzzySimilar title/name (fuzzy) · 59%stabilityai/stable-diffusion-xl-base-1.0 →
“Fuzzy title match (0.73): “LeVo 2: Stable and Melodious Song Generation via Hierarchica” ≈ “stabilityai/stable-diffusion-xl-base-1.0””
- FuzzySimilar title/name (fuzzy) · 59%CompVis/stable-diffusion-v1-4 →
“Fuzzy title match (0.73): “LeVo 2: Stable and Melodious Song Generation via Hierarchica” ≈ “CompVis/stable-diffusion-v1-4””
- FuzzySimilar title/name (fuzzy) · 59%stabilityai/stable-diffusion-3.5-large →
“Fuzzy title match (0.73): “LeVo 2: Stable and Melodious Song Generation via Hierarchica” ≈ “stabilityai/stable-diffusion-3.5-large””
- PossiblePossibly related (embedding) · 54%jaswon/osu-dreamer →
- PossiblePossibly related (embedding) · 51%Natooz/MidiTok →
- PossiblePossibly related (embedding) · 46%rzru/nightingale →
- PossiblePossibly related (embedding) · 46%affige/genmusic_demo_list →
- PossiblePossibly related (embedding) · 48%baidu-baige/LoongForge →
