UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Leon Liangyu, Ma, Haoyu, Fan, Zhipeng, Huang, Ziqi, Sinha, Animesh, Dai, Xiaoliang, Wang, Jialiang, He, Zecheng, Yang, Jianwei, Li, Chunyuan, Sun, Junzhe, Wang, Chu, Yeung-Levy, Serena, Juefei-Xu, Felix |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniT: Unified Geometry Learning with Group Autoregressive Transformer
di: Wang, Haotian, et al.
Pubblicazione: (2026)
di: Wang, Haotian, et al.
Pubblicazione: (2026)
Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
di: Gu, Zeqi, et al.
Pubblicazione: (2025)
di: Gu, Zeqi, et al.
Pubblicazione: (2025)
Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs
di: Zhang, Haochen, et al.
Pubblicazione: (2026)
di: Zhang, Haochen, et al.
Pubblicazione: (2026)
Exploring MLLM-Diffusion Information Transfer with MetaCanvas
di: Lin, Han, et al.
Pubblicazione: (2025)
di: Lin, Han, et al.
Pubblicazione: (2025)
UniT: Data Efficient Tactile Representation with Generalization to Unseen Objects
di: Xu, Zhengtong, et al.
Pubblicazione: (2024)
di: Xu, Zhengtong, et al.
Pubblicazione: (2024)
UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling
di: Chen, Boyu, et al.
Pubblicazione: (2026)
di: Chen, Boyu, et al.
Pubblicazione: (2026)
Llama Learns to Direct: DirectorLLM for Human-Centric Video Generation
di: Song, Kunpeng, et al.
Pubblicazione: (2024)
di: Song, Kunpeng, et al.
Pubblicazione: (2024)
Connect, Collapse, Corrupt: Learning Cross-Modal Tasks with Uni-Modal Data
di: Zhang, Yuhui, et al.
Pubblicazione: (2024)
di: Zhang, Yuhui, et al.
Pubblicazione: (2024)
UniMo: Unified Motion Generation and Understanding with Chain of Thought
di: Wang, Guocun, et al.
Pubblicazione: (2026)
di: Wang, Guocun, et al.
Pubblicazione: (2026)
Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts
di: Liang, Feng, et al.
Pubblicazione: (2025)
di: Liang, Feng, et al.
Pubblicazione: (2025)
MoCha: Towards Movie-Grade Talking Character Synthesis
di: Wei, Cong, et al.
Pubblicazione: (2025)
di: Wei, Cong, et al.
Pubblicazione: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models
di: Endo, Mark, et al.
Pubblicazione: (2025)
di: Endo, Mark, et al.
Pubblicazione: (2025)
Foundation Models Secretly Understand Neural Network Weights: Enhancing Hypernetwork Architectures with Foundation Models
di: Gu, Jeffrey, et al.
Pubblicazione: (2025)
di: Gu, Jeffrey, et al.
Pubblicazione: (2025)
PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation
di: Cai, Yuanhao, et al.
Pubblicazione: (2025)
di: Cai, Yuanhao, et al.
Pubblicazione: (2025)
Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models
di: Sui, Elaine, et al.
Pubblicazione: (2024)
di: Sui, Elaine, et al.
Pubblicazione: (2024)
Continuous Perception Matters: Diagnosing Temporal Integration Failures in Multimodal Models
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
di: Aklilu, Josiah, et al.
Pubblicazione: (2024)
di: Aklilu, Josiah, et al.
Pubblicazione: (2024)
Multi-Human Mesh Recovery with Transformers
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
di: Endo, Mark, et al.
Pubblicazione: (2024)
di: Endo, Mark, et al.
Pubblicazione: (2024)
Self-Harmonized Chain of Thought
di: Jin, Ziqi, et al.
Pubblicazione: (2024)
di: Jin, Ziqi, et al.
Pubblicazione: (2024)
TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning
di: Xu, Junzhe, et al.
Pubblicazione: (2025)
di: Xu, Junzhe, et al.
Pubblicazione: (2025)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
Viewpoint Textual Inversion: Discovering Scene Representations and 3D View Control in 2D Diffusion Models
di: Burgess, James, et al.
Pubblicazione: (2023)
di: Burgess, James, et al.
Pubblicazione: (2023)
Populate-A-Scene: Affordance-Aware Human Video Generation
di: Shan, Mengyi, et al.
Pubblicazione: (2025)
di: Shan, Mengyi, et al.
Pubblicazione: (2025)
Uni-Sign: Toward Unified Sign Language Understanding at Scale
di: Li, Zecheng, et al.
Pubblicazione: (2025)
di: Li, Zecheng, et al.
Pubblicazione: (2025)
Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning
di: Zhang, Lei, et al.
Pubblicazione: (2026)
di: Zhang, Lei, et al.
Pubblicazione: (2026)
UniMotion: A Unified Motion Framework for Simulation, Prediction and Planning
di: Song, Nan, et al.
Pubblicazione: (2026)
di: Song, Nan, et al.
Pubblicazione: (2026)
DeforHMR: Vision Transformer with Deformable Cross-Attention for 3D Human Mesh Recovery
di: Heo, Jaewoo, et al.
Pubblicazione: (2024)
di: Heo, Jaewoo, et al.
Pubblicazione: (2024)
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
C3oT: Generating Shorter Chain-of-Thought without Compromising Effectiveness
di: Kang, Yu, et al.
Pubblicazione: (2024)
di: Kang, Yu, et al.
Pubblicazione: (2024)
UniQuad: A Unified and Versatile Quadrotor Platform Series for UAV Research and Application
di: Zhang, Yichen, et al.
Pubblicazione: (2024)
di: Zhang, Yichen, et al.
Pubblicazione: (2024)
ACIL: Auto Chain of Thoughts for In-Context Learning
di: Chu, Rui
Pubblicazione: (2026)
di: Chu, Rui
Pubblicazione: (2026)
UniEDU: A Unified Language and Vision Assistant for Education Applications
di: Chu, Zhendong, et al.
Pubblicazione: (2025)
di: Chu, Zhendong, et al.
Pubblicazione: (2025)
Motion Diffusion-Guided 3D Global HMR from a Dynamic Camera
di: Heo, Jaewoo, et al.
Pubblicazione: (2024)
di: Heo, Jaewoo, et al.
Pubblicazione: (2024)
UniECG: Understanding and Generating ECG in One Unified Model
di: Jin, Jiarui, et al.
Pubblicazione: (2025)
di: Jin, Jiarui, et al.
Pubblicazione: (2025)
Diffusion-HPC: Synthetic Data Generation for Human Mesh Recovery in Challenging Domains
di: Weng, Zhenzhen, et al.
Pubblicazione: (2023)
di: Weng, Zhenzhen, et al.
Pubblicazione: (2023)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
MuJoCoUni:Persistent Batched Runtime Primitives for MuJoCo
di: Jia, Yufei, et al.
Pubblicazione: (2026)
di: Jia, Yufei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UniT: Unified Geometry Learning with Group Autoregressive Transformer
di: Wang, Haotian, et al.
Pubblicazione: (2026) -
Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
di: Gu, Zeqi, et al.
Pubblicazione: (2025) -
Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs
di: Zhang, Haochen, et al.
Pubblicazione: (2026) -
Exploring MLLM-Diffusion Information Transfer with MetaCanvas
di: Lin, Han, et al.
Pubblicazione: (2025) -
UniT: Data Efficient Tactile Representation with Generalization to Unseen Objects
di: Xu, Zhengtong, et al.
Pubblicazione: (2024)