Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Dang, Yunkai, Jiang, Yifan, Jiang, Yizhu, Chen, Anqi, Li, Wenbin, Gao, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models
por: Dang, Yunkai, et al.
Publicado: (2026)
por: Dang, Yunkai, et al.
Publicado: (2026)
UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2026)
por: Dang, Yunkai, et al.
Publicado: (2026)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
por: Qu, Liao, et al.
Publicado: (2024)
por: Qu, Liao, et al.
Publicado: (2024)
Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation
por: Zhao, Yunpu, et al.
Publicado: (2025)
por: Zhao, Yunpu, et al.
Publicado: (2025)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
por: Jiao, Yang, et al.
Publicado: (2025)
por: Jiao, Yang, et al.
Publicado: (2025)
Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding
por: Jiang, Yibo, et al.
Publicado: (2026)
por: Jiang, Yibo, et al.
Publicado: (2026)
Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
por: Yang, Jiacheng, et al.
Publicado: (2026)
por: Yang, Jiacheng, et al.
Publicado: (2026)
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
por: Zhuang, Shaobin, et al.
Publicado: (2026)
por: Zhuang, Shaobin, et al.
Publicado: (2026)
A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
por: Ma, Chuofan, et al.
Publicado: (2025)
por: Ma, Chuofan, et al.
Publicado: (2025)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
por: Liu, Zeyu, et al.
Publicado: (2026)
por: Liu, Zeyu, et al.
Publicado: (2026)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
por: Wang, Yixu, et al.
Publicado: (2025)
por: Wang, Yixu, et al.
Publicado: (2025)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
por: Ma, Chuofan, et al.
Publicado: (2024)
por: Ma, Chuofan, et al.
Publicado: (2024)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
por: Ding, Meiwen, et al.
Publicado: (2026)
por: Ding, Meiwen, et al.
Publicado: (2026)
Mode-as-Sequence: Translating Multimodal Motion Prediction into Unified Sequential Mode Modeling
por: Zhou, Zikang, et al.
Publicado: (2026)
por: Zhou, Zikang, et al.
Publicado: (2026)
Lance: Unified Multimodal Modeling by Multi-Task Synergy
por: Fu, Fengyi, et al.
Publicado: (2026)
por: Fu, Fengyi, et al.
Publicado: (2026)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
por: Wang, Xinhao, et al.
Publicado: (2026)
por: Wang, Xinhao, et al.
Publicado: (2026)
PAR: Prompt-Aware Token Reduction Method for Efficient Large Multimodal Models
por: Liu, Yingen, et al.
Publicado: (2024)
por: Liu, Yingen, et al.
Publicado: (2024)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
por: Fang, Yiyang, et al.
Publicado: (2026)
por: Fang, Yiyang, et al.
Publicado: (2026)
AviationLMM: A Large Multimodal Foundation Model for Civil Aviation
por: Li, Wenbin, et al.
Publicado: (2026)
por: Li, Wenbin, et al.
Publicado: (2026)
Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models
por: Xing, Wenbin, et al.
Publicado: (2026)
por: Xing, Wenbin, et al.
Publicado: (2026)
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
por: Zhang, Huichao, et al.
Publicado: (2026)
por: Zhang, Huichao, et al.
Publicado: (2026)
NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
por: Wu, Kai, et al.
Publicado: (2024)
por: Wu, Kai, et al.
Publicado: (2024)
AToken: A Unified Tokenizer for Vision
por: Lu, Jiasen, et al.
Publicado: (2025)
por: Lu, Jiasen, et al.
Publicado: (2025)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
por: Zhao, Zihui, et al.
Publicado: (2025)
por: Zhao, Zihui, et al.
Publicado: (2025)
What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph
por: Jiang, Yutao, et al.
Publicado: (2025)
por: Jiang, Yutao, et al.
Publicado: (2025)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
por: Zhou, Ziqin, et al.
Publicado: (2025)
por: Zhou, Ziqin, et al.
Publicado: (2025)
UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?
por: Wen, Zimo, et al.
Publicado: (2026)
por: Wen, Zimo, et al.
Publicado: (2026)
Semantic Generative Tuning for Unified Multimodal Models
por: Yu, Songsong, et al.
Publicado: (2026)
por: Yu, Songsong, et al.
Publicado: (2026)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
por: Jiang, Siyang, et al.
Publicado: (2025)
por: Jiang, Siyang, et al.
Publicado: (2025)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
por: Wu, Penghao, et al.
Publicado: (2025)
por: Wu, Penghao, et al.
Publicado: (2025)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
por: Chen, Zisheng, et al.
Publicado: (2025)
por: Chen, Zisheng, et al.
Publicado: (2025)
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
por: Zhang, Guiwei, et al.
Publicado: (2025)
por: Zhang, Guiwei, et al.
Publicado: (2025)
Forecasting When to Forecast: Accelerating Diffusion Models with Confidence-Gated Taylor
por: Guan, Xiaoliu, et al.
Publicado: (2025)
por: Guan, Xiaoliu, et al.
Publicado: (2025)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
por: Mao, Jiawei, et al.
Publicado: (2025)
por: Mao, Jiawei, et al.
Publicado: (2025)
Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans
por: Qin, Sizhong, et al.
Publicado: (2026)
por: Qin, Sizhong, et al.
Publicado: (2026)
UniHOI: Unified Human-Object Interaction Understanding via Unified Token Space
por: Yang, Panqi, et al.
Publicado: (2025)
por: Yang, Panqi, et al.
Publicado: (2025)
Ejemplares similares
-
CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models
por: Dang, Yunkai, et al.
Publicado: (2026) -
UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2026) -
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2025) -
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
por: Qu, Liao, et al.
Publicado: (2024) -
Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation
por: Zhao, Yunpu, et al.
Publicado: (2025)