Two-Scale Latent Dynamics for Recurrent-Depth Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pappone, Francesco, Crisostomi, Donato, Rodolà, Emanuele |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Model Merging Improves Zero-Shot Generalization in Bioacoustic Foundation Models
par: Marincione, Davide, et autres
Publié: (2025)
par: Marincione, Davide, et autres
Publié: (2025)
$C^2M^3$: Cycle-Consistent Multi-Model Merging
par: Crisostomi, Donato, et autres
Publié: (2024)
par: Crisostomi, Donato, et autres
Publié: (2024)
Navigating the Latent Space Dynamics of Neural Models
par: Fumero, Marco, et autres
Publié: (2025)
par: Fumero, Marco, et autres
Publié: (2025)
Language Models are Injective and Hence Invertible
par: Nikolaou, Giorgos, et autres
Publié: (2025)
par: Nikolaou, Giorgos, et autres
Publié: (2025)
Metric Based Few-Shot Graph Classification
par: Crisostomi, Donato, et autres
Publié: (2022)
par: Crisostomi, Donato, et autres
Publié: (2022)
Mergenetic: a Simple Evolutionary Model Merging Library
par: Minut, Adrian Robert, et autres
Publié: (2025)
par: Minut, Adrian Robert, et autres
Publié: (2025)
MERGE$^3$: Efficient Evolutionary Merging on Consumer-grade GPUs
par: Mencattini, Tommaso, et autres
Publié: (2025)
par: Mencattini, Tommaso, et autres
Publié: (2025)
Model Merging: Foundations and Algorithms
par: Crisostomi, Donato
Publié: (2026)
par: Crisostomi, Donato
Publié: (2026)
Update Your Transformer to the Latest Release: Re-Basin of Task Vectors
par: Rinaldi, Filippo, et autres
Publié: (2025)
par: Rinaldi, Filippo, et autres
Publié: (2025)
ATM: Improving Model Merging by Alternating Tuning and Merging
par: Zhou, Luca, et autres
Publié: (2024)
par: Zhou, Luca, et autres
Publié: (2024)
Membership and Dataset Inference Attacks on Large Audio Generative Models
par: Proboszcz, Jakub, et autres
Publié: (2025)
par: Proboszcz, Jakub, et autres
Publié: (2025)
Implicit Inversion turns CLIP into a Decoder
par: D'Orazio, Antonio, et autres
Publié: (2025)
par: D'Orazio, Antonio, et autres
Publié: (2025)
Latent Space Translation via Inverse Relative Projection
par: Maiorca, Valentino, et autres
Publié: (2024)
par: Maiorca, Valentino, et autres
Publié: (2024)
Latent Functional Maps: a spectral framework for representation alignment
par: Fumero, Marco, et autres
Publié: (2024)
par: Fumero, Marco, et autres
Publié: (2024)
Task Singular Vectors: Reducing Task Interference in Model Merging
par: Gargiulo, Antonio Andrea, et autres
Publié: (2024)
par: Gargiulo, Antonio Andrea, et autres
Publié: (2024)
On Task Vectors and Gradients
par: Zhou, Luca, et autres
Publié: (2025)
par: Zhou, Luca, et autres
Publié: (2025)
Multi-Way Representation Alignment
par: Achara, Akshit, et autres
Publié: (2026)
par: Achara, Akshit, et autres
Publié: (2026)
Latent Space Translation via Semantic Alignment
par: Maiorca, Valentino, et autres
Publié: (2023)
par: Maiorca, Valentino, et autres
Publié: (2023)
Domain Elastic Transform: Bayesian Function Registration for High-Dimensional Scientific Data
par: Hirose, Osamu, et autres
Publié: (2026)
par: Hirose, Osamu, et autres
Publié: (2026)
How Neural Losses Shape VAE Latents
par: Strano, Giorgio, et autres
Publié: (2026)
par: Strano, Giorgio, et autres
Publié: (2026)
Latent Spectral Regularization for Continual Learning
par: Frascaroli, Emanuele, et autres
Publié: (2023)
par: Frascaroli, Emanuele, et autres
Publié: (2023)
MASS: MoErging through Adaptive Subspace Selection
par: Crisostomi, Donato, et autres
Publié: (2025)
par: Crisostomi, Donato, et autres
Publié: (2025)
Communicating Sound Through Natural Language
par: Rossi, Emanuele, et autres
Publié: (2026)
par: Rossi, Emanuele, et autres
Publié: (2026)
From Bricks to Bridges: Product of Invariances to Enhance Latent Space Communication
par: Cannistraci, Irene, et autres
Publié: (2023)
par: Cannistraci, Irene, et autres
Publié: (2023)
ResiDual Transformer Alignment with Spectral Decomposition
par: Basile, Lorenzo, et autres
Publié: (2024)
par: Basile, Lorenzo, et autres
Publié: (2024)
Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer
par: Lu, Wenquan, et autres
Publié: (2025)
par: Lu, Wenquan, et autres
Publié: (2025)
TOAST: Transformer Optimization using Adaptive and Simple Transformations
par: Cannistraci, Irene, et autres
Publié: (2024)
par: Cannistraci, Irene, et autres
Publié: (2024)
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
par: Geiping, Jonas, et autres
Publié: (2025)
par: Geiping, Jonas, et autres
Publié: (2025)
LoopGen: Training-Free Loopable Music Generation
par: Marincione, Davide, et autres
Publié: (2025)
par: Marincione, Davide, et autres
Publié: (2025)
Efficient Generation of Multimodal Fluid Simulation Data
par: Baieri, Daniele, et autres
Publié: (2023)
par: Baieri, Daniele, et autres
Publié: (2023)
Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior
par: Huang, Zeyi, et autres
Publié: (2026)
par: Huang, Zeyi, et autres
Publié: (2026)
EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding
par: Cerovaz, Luca, et autres
Publié: (2026)
par: Cerovaz, Luca, et autres
Publié: (2026)
The Recurrent Transformer: Greater Effective Depth and Efficient Decoding
par: Oncescu, Costin-Andrei, et autres
Publié: (2026)
par: Oncescu, Costin-Andrei, et autres
Publié: (2026)
Naturalistic Music Decoding from EEG Data via Latent Diffusion Models
par: Postolache, Emilian, et autres
Publié: (2024)
par: Postolache, Emilian, et autres
Publié: (2024)
Depth-Recurrent Attention Mixtures: Giving Latent Reasoning the Attention it Deserves
par: Knupp, Jonas, et autres
Publié: (2026)
par: Knupp, Jonas, et autres
Publié: (2026)
Accelerating Transformer Inference for Translation via Parallel Decoding
par: Santilli, Andrea, et autres
Publié: (2023)
par: Santilli, Andrea, et autres
Publié: (2023)
STAGE: Stemmed Accompaniment Generation through Prefix-Based Conditioning
par: Strano, Giorgio, et autres
Publié: (2025)
par: Strano, Giorgio, et autres
Publié: (2025)
Not All Latent Spaces Are Flat: Hyperbolic Concept Control
par: Briglia, Maria Rosaria, et autres
Publié: (2026)
par: Briglia, Maria Rosaria, et autres
Publié: (2026)
Thinking Deeper, Not Longer: Depth-Recurrent Transformers for Compositional Generalization
par: Chen, Hung-Hsuan
Publié: (2026)
par: Chen, Hung-Hsuan
Publié: (2026)
Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers
par: Kohli, Harsh, et autres
Publié: (2026)
par: Kohli, Harsh, et autres
Publié: (2026)
Documents similaires
-
Model Merging Improves Zero-Shot Generalization in Bioacoustic Foundation Models
par: Marincione, Davide, et autres
Publié: (2025) -
$C^2M^3$: Cycle-Consistent Multi-Model Merging
par: Crisostomi, Donato, et autres
Publié: (2024) -
Navigating the Latent Space Dynamics of Neural Models
par: Fumero, Marco, et autres
Publié: (2025) -
Language Models are Injective and Hence Invertible
par: Nikolaou, Giorgos, et autres
Publié: (2025) -
Metric Based Few-Shot Graph Classification
par: Crisostomi, Donato, et autres
Publié: (2022)