Two-Scale Latent Dynamics for Recurrent-Depth Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Pappone, Francesco, Crisostomi, Donato, Rodolà, Emanuele |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Model Merging Improves Zero-Shot Generalization in Bioacoustic Foundation Models
di: Marincione, Davide, et al.
Pubblicazione: (2025)
di: Marincione, Davide, et al.
Pubblicazione: (2025)
$C^2M^3$: Cycle-Consistent Multi-Model Merging
di: Crisostomi, Donato, et al.
Pubblicazione: (2024)
di: Crisostomi, Donato, et al.
Pubblicazione: (2024)
Navigating the Latent Space Dynamics of Neural Models
di: Fumero, Marco, et al.
Pubblicazione: (2025)
di: Fumero, Marco, et al.
Pubblicazione: (2025)
Language Models are Injective and Hence Invertible
di: Nikolaou, Giorgos, et al.
Pubblicazione: (2025)
di: Nikolaou, Giorgos, et al.
Pubblicazione: (2025)
Metric Based Few-Shot Graph Classification
di: Crisostomi, Donato, et al.
Pubblicazione: (2022)
di: Crisostomi, Donato, et al.
Pubblicazione: (2022)
Mergenetic: a Simple Evolutionary Model Merging Library
di: Minut, Adrian Robert, et al.
Pubblicazione: (2025)
di: Minut, Adrian Robert, et al.
Pubblicazione: (2025)
MERGE$^3$: Efficient Evolutionary Merging on Consumer-grade GPUs
di: Mencattini, Tommaso, et al.
Pubblicazione: (2025)
di: Mencattini, Tommaso, et al.
Pubblicazione: (2025)
Model Merging: Foundations and Algorithms
di: Crisostomi, Donato
Pubblicazione: (2026)
di: Crisostomi, Donato
Pubblicazione: (2026)
Update Your Transformer to the Latest Release: Re-Basin of Task Vectors
di: Rinaldi, Filippo, et al.
Pubblicazione: (2025)
di: Rinaldi, Filippo, et al.
Pubblicazione: (2025)
ATM: Improving Model Merging by Alternating Tuning and Merging
di: Zhou, Luca, et al.
Pubblicazione: (2024)
di: Zhou, Luca, et al.
Pubblicazione: (2024)
Membership and Dataset Inference Attacks on Large Audio Generative Models
di: Proboszcz, Jakub, et al.
Pubblicazione: (2025)
di: Proboszcz, Jakub, et al.
Pubblicazione: (2025)
Implicit Inversion turns CLIP into a Decoder
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
Latent Space Translation via Inverse Relative Projection
di: Maiorca, Valentino, et al.
Pubblicazione: (2024)
di: Maiorca, Valentino, et al.
Pubblicazione: (2024)
Latent Functional Maps: a spectral framework for representation alignment
di: Fumero, Marco, et al.
Pubblicazione: (2024)
di: Fumero, Marco, et al.
Pubblicazione: (2024)
Task Singular Vectors: Reducing Task Interference in Model Merging
di: Gargiulo, Antonio Andrea, et al.
Pubblicazione: (2024)
di: Gargiulo, Antonio Andrea, et al.
Pubblicazione: (2024)
On Task Vectors and Gradients
di: Zhou, Luca, et al.
Pubblicazione: (2025)
di: Zhou, Luca, et al.
Pubblicazione: (2025)
Multi-Way Representation Alignment
di: Achara, Akshit, et al.
Pubblicazione: (2026)
di: Achara, Akshit, et al.
Pubblicazione: (2026)
Latent Space Translation via Semantic Alignment
di: Maiorca, Valentino, et al.
Pubblicazione: (2023)
di: Maiorca, Valentino, et al.
Pubblicazione: (2023)
Domain Elastic Transform: Bayesian Function Registration for High-Dimensional Scientific Data
di: Hirose, Osamu, et al.
Pubblicazione: (2026)
di: Hirose, Osamu, et al.
Pubblicazione: (2026)
How Neural Losses Shape VAE Latents
di: Strano, Giorgio, et al.
Pubblicazione: (2026)
di: Strano, Giorgio, et al.
Pubblicazione: (2026)
Latent Spectral Regularization for Continual Learning
di: Frascaroli, Emanuele, et al.
Pubblicazione: (2023)
di: Frascaroli, Emanuele, et al.
Pubblicazione: (2023)
MASS: MoErging through Adaptive Subspace Selection
di: Crisostomi, Donato, et al.
Pubblicazione: (2025)
di: Crisostomi, Donato, et al.
Pubblicazione: (2025)
Communicating Sound Through Natural Language
di: Rossi, Emanuele, et al.
Pubblicazione: (2026)
di: Rossi, Emanuele, et al.
Pubblicazione: (2026)
From Bricks to Bridges: Product of Invariances to Enhance Latent Space Communication
di: Cannistraci, Irene, et al.
Pubblicazione: (2023)
di: Cannistraci, Irene, et al.
Pubblicazione: (2023)
ResiDual Transformer Alignment with Spectral Decomposition
di: Basile, Lorenzo, et al.
Pubblicazione: (2024)
di: Basile, Lorenzo, et al.
Pubblicazione: (2024)
Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
TOAST: Transformer Optimization using Adaptive and Simple Transformations
di: Cannistraci, Irene, et al.
Pubblicazione: (2024)
di: Cannistraci, Irene, et al.
Pubblicazione: (2024)
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
di: Geiping, Jonas, et al.
Pubblicazione: (2025)
di: Geiping, Jonas, et al.
Pubblicazione: (2025)
LoopGen: Training-Free Loopable Music Generation
di: Marincione, Davide, et al.
Pubblicazione: (2025)
di: Marincione, Davide, et al.
Pubblicazione: (2025)
Efficient Generation of Multimodal Fluid Simulation Data
di: Baieri, Daniele, et al.
Pubblicazione: (2023)
di: Baieri, Daniele, et al.
Pubblicazione: (2023)
Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior
di: Huang, Zeyi, et al.
Pubblicazione: (2026)
di: Huang, Zeyi, et al.
Pubblicazione: (2026)
EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding
di: Cerovaz, Luca, et al.
Pubblicazione: (2026)
di: Cerovaz, Luca, et al.
Pubblicazione: (2026)
The Recurrent Transformer: Greater Effective Depth and Efficient Decoding
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2026)
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2026)
Naturalistic Music Decoding from EEG Data via Latent Diffusion Models
di: Postolache, Emilian, et al.
Pubblicazione: (2024)
di: Postolache, Emilian, et al.
Pubblicazione: (2024)
Depth-Recurrent Attention Mixtures: Giving Latent Reasoning the Attention it Deserves
di: Knupp, Jonas, et al.
Pubblicazione: (2026)
di: Knupp, Jonas, et al.
Pubblicazione: (2026)
Accelerating Transformer Inference for Translation via Parallel Decoding
di: Santilli, Andrea, et al.
Pubblicazione: (2023)
di: Santilli, Andrea, et al.
Pubblicazione: (2023)
STAGE: Stemmed Accompaniment Generation through Prefix-Based Conditioning
di: Strano, Giorgio, et al.
Pubblicazione: (2025)
di: Strano, Giorgio, et al.
Pubblicazione: (2025)
Not All Latent Spaces Are Flat: Hyperbolic Concept Control
di: Briglia, Maria Rosaria, et al.
Pubblicazione: (2026)
di: Briglia, Maria Rosaria, et al.
Pubblicazione: (2026)
Thinking Deeper, Not Longer: Depth-Recurrent Transformers for Compositional Generalization
di: Chen, Hung-Hsuan
Pubblicazione: (2026)
di: Chen, Hung-Hsuan
Pubblicazione: (2026)
Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Model Merging Improves Zero-Shot Generalization in Bioacoustic Foundation Models
di: Marincione, Davide, et al.
Pubblicazione: (2025) -
$C^2M^3$: Cycle-Consistent Multi-Model Merging
di: Crisostomi, Donato, et al.
Pubblicazione: (2024) -
Navigating the Latent Space Dynamics of Neural Models
di: Fumero, Marco, et al.
Pubblicazione: (2025) -
Language Models are Injective and Hence Invertible
di: Nikolaou, Giorgos, et al.
Pubblicazione: (2025) -
Metric Based Few-Shot Graph Classification
di: Crisostomi, Donato, et al.
Pubblicazione: (2022)