Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pappa, Massimiliano, Romani, Luca, Sacco, Valentino, Palma, Alessio, Lathuilière, Stéphane, Galasso, Fabio, Alameda-Pineda, Xavier, Spinelli, Indro |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MoDiPO: text-to-motion alignment via AI-feedback-driven Direct Preference Optimization
par: Pappa, Massimiliano, et autres
Publié: (2024)
par: Pappa, Massimiliano, et autres
Publié: (2024)
Length-Aware Motion Synthesis via Latent Diffusion
par: Sampieri, Alessio, et autres
Publié: (2024)
par: Sampieri, Alessio, et autres
Publié: (2024)
Following the Human Thread in Social Navigation
par: Scofano, Luca, et autres
Publié: (2024)
par: Scofano, Luca, et autres
Publié: (2024)
OVOSE: Open-Vocabulary Semantic Segmentation in Event-Based Cameras
par: Rahman, Muhammad Rameez Ur, et autres
Publié: (2024)
par: Rahman, Muhammad Rameez Ur, et autres
Publié: (2024)
Bimanual Robot Manipulation via Multi-Agent In-Context Learning
par: Palma, Alessio, et autres
Publié: (2026)
par: Palma, Alessio, et autres
Publié: (2026)
MonSTeR: a Unified Model for Motion, Scene, Text Retrieval
par: Collorone, Luca, et autres
Publié: (2025)
par: Collorone, Luca, et autres
Publié: (2025)
Residual Tokens Enhance Masked Autoencoders for Speech Modeling
par: Sadok, Samir, et autres
Publié: (2026)
par: Sadok, Samir, et autres
Publié: (2026)
Social EgoMesh Estimation
par: Scofano, Luca, et autres
Publié: (2024)
par: Scofano, Luca, et autres
Publié: (2024)
PhysTalk: Language-driven Real-time Physics in 3D Gaussian Scenes
par: Collorone, Luca, et autres
Publié: (2025)
par: Collorone, Luca, et autres
Publié: (2025)
Human Motion Unlearning
par: De Matteis, Edoardo, et autres
Publié: (2025)
par: De Matteis, Edoardo, et autres
Publié: (2025)
Quantifying Self-Preservation Bias in Large Language Models
par: Migliarini, Matteo, et autres
Publié: (2026)
par: Migliarini, Matteo, et autres
Publié: (2026)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
par: De Min, Thomas, et autres
Publié: (2026)
par: De Min, Thomas, et autres
Publié: (2026)
CaTS-Bench: Can Language Models Describe Time Series?
par: Zhou, Luca, et autres
Publié: (2025)
par: Zhou, Luca, et autres
Publié: (2025)
Video Unlearning via Low-Rank Refusal Vector
par: Facchiano, Simone, et autres
Publié: (2025)
par: Facchiano, Simone, et autres
Publié: (2025)
ANTHROPOS-V: benchmarking the novel task of Crowd Volume Estimation
par: Collorone, Luca, et autres
Publié: (2025)
par: Collorone, Luca, et autres
Publié: (2025)
LongCodeBench: Evaluating Coding LLMs at 1M Context Windows
par: Rando, Stefano, et autres
Publié: (2025)
par: Rando, Stefano, et autres
Publié: (2025)
SeRpEnt: Selective Resampling for Expressive State Space Models
par: Rando, Stefano, et autres
Publié: (2025)
par: Rando, Stefano, et autres
Publié: (2025)
Diffusion Reinforcement Learning via Centered Reward Distillation
par: Zhu, Yuanzhi, et autres
Publié: (2026)
par: Zhu, Yuanzhi, et autres
Publié: (2026)
The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs
par: Sadok, Samir, et autres
Publié: (2026)
par: Sadok, Samir, et autres
Publié: (2026)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
par: Kammoun, Sofiene, et autres
Publié: (2025)
par: Kammoun, Sofiene, et autres
Publié: (2025)
A Comprehensive Multi-scale Approach for Speech and Dynamics Synchrony in Talking Head Generation
par: Airale, Louis, et autres
Publié: (2023)
par: Airale, Louis, et autres
Publié: (2023)
Di$\mathtt{[M]}$O: Distilling Masked Diffusion Models into One-step Generator
par: Zhu, Yuanzhi, et autres
Publié: (2025)
par: Zhu, Yuanzhi, et autres
Publié: (2025)
Adaptive Point Transformer
par: Baiocchi, Alessandro, et autres
Publié: (2024)
par: Baiocchi, Alessandro, et autres
Publié: (2024)
Specify and Edit: Overcoming Ambiguity in Text-Based Image Editing
par: Iakovleva, Ekaterina, et autres
Publié: (2024)
par: Iakovleva, Ekaterina, et autres
Publié: (2024)
Strict Quantization for Compact Pseudo-Kähler Manifolds and Group Actions
par: Galasso, Andrea
Publié: (2024)
par: Galasso, Andrea
Publié: (2024)
OpenSocInt: A Multi-modal Training Environment for Human-Aware Social Navigation
par: Sanchez, Victor, et autres
Publié: (2026)
par: Sanchez, Victor, et autres
Publié: (2026)
Univariate Radial Basis Function Layers: Brain-inspired Deep Neural Layers for Low-Dimensional Inputs
par: Jost, Daniel, et autres
Publié: (2023)
par: Jost, Daniel, et autres
Publié: (2023)
Less is more: Summarizing Patch Tokens for efficient Multi-Label Class-Incremental Learning
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
Group-robust Machine Unlearning
par: De Min, Thomas, et autres
Publié: (2025)
par: De Min, Thomas, et autres
Publié: (2025)
Unlearning Personal Data from a Single Image
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
GATSY: Graph Attention Network for Music Artist Similarity
par: Di Francesco, Andrea Giuseppe, et autres
Publié: (2023)
par: Di Francesco, Andrea Giuseppe, et autres
Publié: (2023)
About latent roles in forecasting players in team sports
par: Scofano, Luca, et autres
Publié: (2023)
par: Scofano, Luca, et autres
Publié: (2023)
MEGA: Masked Generative Autoencoder for Human Mesh Recovery
par: Fiche, Guénolé, et autres
Publié: (2024)
par: Fiche, Guénolé, et autres
Publié: (2024)
Posterior Transition Modeling for Unsupervised Diffusion-Based Speech Enhancement
par: Sadeghi, Mostafa, et autres
Publié: (2025)
par: Sadeghi, Mostafa, et autres
Publié: (2025)
Diffusion-based Unsupervised Audio-visual Speech Enhancement
par: Ayilo, Jean-Eudes, et autres
Publié: (2024)
par: Ayilo, Jean-Eudes, et autres
Publié: (2024)
Diffusion-based Frameworks for Unsupervised Speech Enhancement
par: Ayilo, Jean-Eudes, et autres
Publié: (2026)
par: Ayilo, Jean-Eudes, et autres
Publié: (2026)
Layover or Direct Flight: Rethinking Audio-Guided Image Segmentation
par: Santos, Joel Alberto, et autres
Publié: (2025)
par: Santos, Joel Alberto, et autres
Publié: (2025)
Historia de los griegos / Indro Montanelli ; traducción de Domingo Pruna
par: Montanelli, Indro
par: Montanelli, Indro
Activation Patching for Interpretable Steering in Music Generation
par: Facchiano, Simone, et autres
Publié: (2025)
par: Facchiano, Simone, et autres
Publié: (2025)
A multimodal dynamical variational autoencoder for audiovisual speech representation learning
par: Sadok, Samir, et autres
Publié: (2023)
par: Sadok, Samir, et autres
Publié: (2023)
Documents similaires
-
MoDiPO: text-to-motion alignment via AI-feedback-driven Direct Preference Optimization
par: Pappa, Massimiliano, et autres
Publié: (2024) -
Length-Aware Motion Synthesis via Latent Diffusion
par: Sampieri, Alessio, et autres
Publié: (2024) -
Following the Human Thread in Social Navigation
par: Scofano, Luca, et autres
Publié: (2024) -
OVOSE: Open-Vocabulary Semantic Segmentation in Event-Based Cameras
par: Rahman, Muhammad Rameez Ur, et autres
Publié: (2024) -
Bimanual Robot Manipulation via Multi-Agent In-Context Learning
par: Palma, Alessio, et autres
Publié: (2026)