CrystaL: Spontaneous Emergence of Visual Latents in MLLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yang, Li, Danyang, Li, Yuxuan, Zhang, Xin, Xie, Tianyu, Cheng, Mingming, Li, Xiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
por: Liu, Xiaolin, et al.
Publicado: (2026)
por: Liu, Xiaolin, et al.
Publicado: (2026)
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
por: Li, Qiaoru, et al.
Publicado: (2026)
por: Li, Qiaoru, et al.
Publicado: (2026)
Dense Connector for MLLMs
por: Yao, Huanjin, et al.
Publicado: (2024)
por: Yao, Huanjin, et al.
Publicado: (2024)
Compress3D: a Compressed Latent Space for 3D Generation from a Single Image
por: Zhang, Bowen, et al.
Publicado: (2024)
por: Zhang, Bowen, et al.
Publicado: (2024)
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
por: Li, Yuanshuai, et al.
Publicado: (2025)
por: Li, Yuanshuai, et al.
Publicado: (2025)
EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations
por: Heng, Yongrui, et al.
Publicado: (2026)
por: Heng, Yongrui, et al.
Publicado: (2026)
Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning
por: Guo, Garvin, et al.
Publicado: (2026)
por: Guo, Garvin, et al.
Publicado: (2026)
StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning
por: He, Xixiang, et al.
Publicado: (2026)
por: He, Xixiang, et al.
Publicado: (2026)
Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
por: Ou, Siqu, et al.
Publicado: (2026)
por: Ou, Siqu, et al.
Publicado: (2026)
When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs
por: Cao, Fanpu, et al.
Publicado: (2026)
por: Cao, Fanpu, et al.
Publicado: (2026)
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
por: Jiang, Yankai, et al.
Publicado: (2026)
por: Jiang, Yankai, et al.
Publicado: (2026)
AdaCodec: A Predictive Visual Code for Video MLLMs
por: Hou, Haowen, et al.
Publicado: (2026)
por: Hou, Haowen, et al.
Publicado: (2026)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
por: Cai, Yuxuan, et al.
Publicado: (2025)
por: Cai, Yuxuan, et al.
Publicado: (2025)
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
por: Zhang, Guiwei, et al.
Publicado: (2025)
por: Zhang, Guiwei, et al.
Publicado: (2025)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
por: Zhang, Qizhe, et al.
Publicado: (2025)
por: Zhang, Qizhe, et al.
Publicado: (2025)
Dual Latent Memory for Visual Multi-agent System
por: Yu, Xinlei, et al.
Publicado: (2026)
por: Yu, Xinlei, et al.
Publicado: (2026)
The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
por: Sun, Yuwei, et al.
Publicado: (2026)
por: Sun, Yuwei, et al.
Publicado: (2026)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
por: Xu, Beining, et al.
Publicado: (2025)
por: Xu, Beining, et al.
Publicado: (2025)
Stabilize the Latent Space for Image Autoregressive Modeling: A Unified Perspective
por: Zhu, Yongxin, et al.
Publicado: (2024)
por: Zhu, Yongxin, et al.
Publicado: (2024)
RynnEC: Bringing MLLMs into Embodied World
por: Dang, Ronghao, et al.
Publicado: (2025)
por: Dang, Ronghao, et al.
Publicado: (2025)
Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes
por: Ling, Chen, et al.
Publicado: (2026)
por: Ling, Chen, et al.
Publicado: (2026)
Thinking Ahead: Foresight Intelligence in MLLMs and World Models
por: Gong, Zhantao, et al.
Publicado: (2025)
por: Gong, Zhantao, et al.
Publicado: (2025)
Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives
por: Jiang, Kai, et al.
Publicado: (2025)
por: Jiang, Kai, et al.
Publicado: (2025)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
por: Hao, Haihong, et al.
Publicado: (2026)
por: Hao, Haihong, et al.
Publicado: (2026)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
por: Jiang, Pengfei, et al.
Publicado: (2025)
por: Jiang, Pengfei, et al.
Publicado: (2025)
Latent-Info and Low-Dimensional Learning for Human Mesh Recovery and Parallel Optimization
por: Zhang, Xiang, et al.
Publicado: (2025)
por: Zhang, Xiang, et al.
Publicado: (2025)
InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs
por: Tang, Lv, et al.
Publicado: (2026)
por: Tang, Lv, et al.
Publicado: (2026)
LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
por: Sun, Shichu, et al.
Publicado: (2025)
por: Sun, Shichu, et al.
Publicado: (2025)
A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators
por: Zhou, Jiazhou, et al.
Publicado: (2026)
por: Zhou, Jiazhou, et al.
Publicado: (2026)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
por: Qiu, Yansheng, et al.
Publicado: (2025)
por: Qiu, Yansheng, et al.
Publicado: (2025)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
por: Tan, Yifan, et al.
Publicado: (2026)
por: Tan, Yifan, et al.
Publicado: (2026)
MLLMs-Augmented Visual-Language Representation Learning
por: Liu, Yanqing, et al.
Publicado: (2023)
por: Liu, Yanqing, et al.
Publicado: (2023)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
por: Mei, Xiaodong, et al.
Publicado: (2026)
por: Mei, Xiaodong, et al.
Publicado: (2026)
RO-Bench: Large-scale robustness evaluation of MLLMs with text-driven counterfactual videos
por: Yang, Zixi, et al.
Publicado: (2025)
por: Yang, Zixi, et al.
Publicado: (2025)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
por: Xie, Yuxuan, et al.
Publicado: (2024)
por: Xie, Yuxuan, et al.
Publicado: (2024)
Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs
por: Zhang, Haochen, et al.
Publicado: (2026)
por: Zhang, Haochen, et al.
Publicado: (2026)
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
por: Kang, Caixin, et al.
Publicado: (2026)
por: Kang, Caixin, et al.
Publicado: (2026)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
por: Lin, Junming, et al.
Publicado: (2024)
por: Lin, Junming, et al.
Publicado: (2024)
Ejemplares similares
-
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
por: Liu, Xiaolin, et al.
Publicado: (2026) -
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
por: Li, Qiaoru, et al.
Publicado: (2026) -
Dense Connector for MLLMs
por: Yao, Huanjin, et al.
Publicado: (2024) -
Compress3D: a Compressed Latent Space for 3D Generation from a Single Image
por: Zhang, Bowen, et al.
Publicado: (2024) -
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
por: Li, Yuanshuai, et al.
Publicado: (2025)