Unified Multimodal Discrete Diffusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Swerdlow, Alexander, Prabhudesai, Mihir, Gandhi, Siddharth, Pathak, Deepak, Fragkiadaki, Katerina |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Aligning Text-to-Image Diffusion Models with Reward Backpropagation
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2023)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2023)
Diffusion Beats Autoregressive in Data-Constrained Settings
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2025)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2025)
Video Diffusion Alignment via Reward Gradients
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2024)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2024)
Iterative Refinement Improves Compositional Image Generation
di: Jaiswal, Shantanu, et al.
Pubblicazione: (2026)
di: Jaiswal, Shantanu, et al.
Pubblicazione: (2026)
Solving Physics Olympiad via Reinforcement Learning on Physics Simulators
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2026)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2026)
3D Diffuser Actor: Policy Diffusion with 3D Scene Representations
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2024)
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2024)
Unifying 2D and 3D Vision-Language Understanding
di: Jain, Ayush, et al.
Pubblicazione: (2025)
di: Jain, Ayush, et al.
Pubblicazione: (2025)
Self-Questioning Language Models
di: Chen, Lili, et al.
Pubblicazione: (2025)
di: Chen, Lili, et al.
Pubblicazione: (2025)
Energy-based Models are Zero-Shot Planners for Compositional Scene Rearrangement
di: Gkanatsios, Nikolaos, et al.
Pubblicazione: (2023)
di: Gkanatsios, Nikolaos, et al.
Pubblicazione: (2023)
ODIN: A Single Model for 2D and 3D Segmentation
di: Jain, Ayush, et al.
Pubblicazione: (2024)
di: Jain, Ayush, et al.
Pubblicazione: (2024)
RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation
di: Wang, Yufei, et al.
Pubblicazione: (2023)
di: Wang, Yufei, et al.
Pubblicazione: (2023)
RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation
di: Jangir, Yash, et al.
Pubblicazione: (2025)
di: Jangir, Yash, et al.
Pubblicazione: (2025)
Neural MP: A Generalist Neural Motion Planner
di: Dalal, Murtaza, et al.
Pubblicazione: (2024)
di: Dalal, Murtaza, et al.
Pubblicazione: (2024)
SAPG: Split and Aggregate Policy Gradients
di: Singla, Jayesh, et al.
Pubblicazione: (2024)
di: Singla, Jayesh, et al.
Pubblicazione: (2024)
IFG: Internet-Scale Guidance for Functional Grasping Generation
di: Liu, Ray Muxin, et al.
Pubblicazione: (2025)
di: Liu, Ray Muxin, et al.
Pubblicazione: (2025)
FACTR: Force-Attending Curriculum Training for Contact-Rich Policy Learning
di: Liu, Jason Jingzhou, et al.
Pubblicazione: (2025)
di: Liu, Jason Jingzhou, et al.
Pubblicazione: (2025)
Maximizing Confidence Alone Improves Reasoning
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2025)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2025)
Dex4D: Task-Agnostic Point Track Policy for Sim-to-Real Dexterous Manipulation
di: Kuang, Yuxuan, et al.
Pubblicazione: (2026)
di: Kuang, Yuxuan, et al.
Pubblicazione: (2026)
ViPRA: Video Prediction for Robot Actions
di: Routray, Sandeep, et al.
Pubblicazione: (2025)
di: Routray, Sandeep, et al.
Pubblicazione: (2025)
Adaptive Mobile Manipulation for Articulated Objects In the Open World
di: Xiong, Haoyu, et al.
Pubblicazione: (2024)
di: Xiong, Haoyu, et al.
Pubblicazione: (2024)
Bimanual Dexterity for Complex Tasks
di: Shaw, Kenneth, et al.
Pubblicazione: (2024)
di: Shaw, Kenneth, et al.
Pubblicazione: (2024)
Copilot4D: Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion
di: Zhang, Lunjun, et al.
Pubblicazione: (2023)
di: Zhang, Lunjun, et al.
Pubblicazione: (2023)
E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion
di: Zhan, Zhihao, et al.
Pubblicazione: (2025)
di: Zhan, Zhihao, et al.
Pubblicazione: (2025)
Continuously Improving Mobile Manipulation with Autonomous Real-World RL
di: Mendonca, Russell, et al.
Pubblicazione: (2024)
di: Mendonca, Russell, et al.
Pubblicazione: (2024)
SPIN: Simultaneous Perception, Interaction and Navigation
di: Uppal, Shagun, et al.
Pubblicazione: (2024)
di: Uppal, Shagun, et al.
Pubblicazione: (2024)
HELPER-X: A Unified Instructable Embodied Agent to Tackle Four Interactive Vision-Language Domains with Memory-Augmented Language Models
di: Sarch, Gabriel, et al.
Pubblicazione: (2024)
di: Sarch, Gabriel, et al.
Pubblicazione: (2024)
DeTra: A Unified Model for Object Detection and Trajectory Forecasting
di: Casas, Sergio, et al.
Pubblicazione: (2024)
di: Casas, Sergio, et al.
Pubblicazione: (2024)
DexWild: Dexterous Human Interactions for In-the-Wild Robot Policies
di: Tao, Tony, et al.
Pubblicazione: (2025)
di: Tao, Tony, et al.
Pubblicazione: (2025)
Deep Reactive Policy: Learning Reactive Manipulator Motion Planning for Dynamic Environments
di: Yang, Jiahui, et al.
Pubblicazione: (2025)
di: Yang, Jiahui, et al.
Pubblicazione: (2025)
Trajectory Forecasting through Low-Rank Adaptation of Discrete Latent Codes
di: Benaglia, Riccardo, et al.
Pubblicazione: (2024)
di: Benaglia, Riccardo, et al.
Pubblicazione: (2024)
Aether: Geometric-Aware Unified World Modeling
di: Aether Team, et al.
Pubblicazione: (2025)
di: Aether Team, et al.
Pubblicazione: (2025)
Render and Diffuse: Aligning Image and Action Spaces for Diffusion-based Behaviour Cloning
di: Vosylius, Vitalis, et al.
Pubblicazione: (2024)
di: Vosylius, Vitalis, et al.
Pubblicazione: (2024)
Fractional Diffusion Bridge Models
di: Nobis, Gabriel, et al.
Pubblicazione: (2025)
di: Nobis, Gabriel, et al.
Pubblicazione: (2025)
The Ingredients for Robotic Diffusion Transformers
di: Dasari, Sudeep, et al.
Pubblicazione: (2024)
di: Dasari, Sudeep, et al.
Pubblicazione: (2024)
Seeking Physics in Diffusion Noise
di: Tang, Chujun, et al.
Pubblicazione: (2026)
di: Tang, Chujun, et al.
Pubblicazione: (2026)
Any4D: Unified Feed-Forward Metric 4D Reconstruction
di: Karhade, Jay, et al.
Pubblicazione: (2025)
di: Karhade, Jay, et al.
Pubblicazione: (2025)
MapDiffusion: Generative Diffusion for Vectorized Online HD Map Construction and Uncertainty Estimation in Autonomous Driving
di: Monninger, Thomas, et al.
Pubblicazione: (2025)
di: Monninger, Thomas, et al.
Pubblicazione: (2025)
Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
di: Shi, Min, et al.
Pubblicazione: (2024)
di: Shi, Min, et al.
Pubblicazione: (2024)
Audio-3DVG: Unified Audio -- Point Cloud Fusion for 3D Visual Grounding
di: Cao-Dinh, Duc, et al.
Pubblicazione: (2025)
di: Cao-Dinh, Duc, et al.
Pubblicazione: (2025)
Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
di: NVIDIA, et al.
Pubblicazione: (2025)
di: NVIDIA, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Aligning Text-to-Image Diffusion Models with Reward Backpropagation
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2023) -
Diffusion Beats Autoregressive in Data-Constrained Settings
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2025) -
Video Diffusion Alignment via Reward Gradients
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2024) -
Iterative Refinement Improves Compositional Image Generation
di: Jaiswal, Shantanu, et al.
Pubblicazione: (2026) -
Solving Physics Olympiad via Reinforcement Learning on Physics Simulators
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2026)