How Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Hongxuan, Zhang, Yukun, Zhou, Xueqing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Continuous-Time Attention: PDE-Guided Mechanisms for Long-Sequence Transformers
por: Zhang, Yukun, et al.
Publicado: (2025)
por: Zhang, Yukun, et al.
Publicado: (2025)
Where to Add PDE Diffusion in Transformers
por: Zhang, Yukun, et al.
Publicado: (2025)
por: Zhang, Yukun, et al.
Publicado: (2025)
Understanding Transformer Architecture through Continuous Dynamics: A Partial Differential Equation Perspective
por: Zhang, Yukun, et al.
Publicado: (2024)
por: Zhang, Yukun, et al.
Publicado: (2024)
Information-Theoretic Greedy Layer-wise Training for Traffic Sign Recognition
por: Lyu, Shuyan, et al.
Publicado: (2025)
por: Lyu, Shuyan, et al.
Publicado: (2025)
How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
por: Xiao, He, et al.
Publicado: (2025)
por: Xiao, He, et al.
Publicado: (2025)
From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
por: Zhou, Chenyue, et al.
Publicado: (2025)
por: Zhou, Chenyue, et al.
Publicado: (2025)
Disentangling Recall and Reasoning in Transformer Models through Layer-wise Attention and Activation Analysis
por: Fartale, Harshwardhan, et al.
Publicado: (2025)
por: Fartale, Harshwardhan, et al.
Publicado: (2025)
A Layer-wise Analysis of Supervised Fine-Tuning
por: Zhao, Qinghua, et al.
Publicado: (2026)
por: Zhao, Qinghua, et al.
Publicado: (2026)
Hierarchical Alignment: Surgical Fine-Tuning via Functional Layer Specialization in Large Language Models
por: Zhang, Yukun, et al.
Publicado: (2025)
por: Zhang, Yukun, et al.
Publicado: (2025)
Read and Think: An Efficient Step-wise Multimodal Language Model for Document Understanding and Reasoning
por: Zhang, Jinxu
Publicado: (2024)
por: Zhang, Jinxu
Publicado: (2024)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
por: Jin, Ruihan, et al.
Publicado: (2024)
por: Jin, Ruihan, et al.
Publicado: (2024)
Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control
por: Li, Shunlei, et al.
Publicado: (2025)
por: Li, Shunlei, et al.
Publicado: (2025)
Addition in Four Movements: Mapping Layer-wise Information Trajectories in LLMs
por: Yan, Yao
Publicado: (2025)
por: Yan, Yao
Publicado: (2025)
Layer-wise Regularized Dropout for Neural Language Models
por: Ni, Shiwen, et al.
Publicado: (2024)
por: Ni, Shiwen, et al.
Publicado: (2024)
SlimGPT: Layer-wise Structured Pruning for Large Language Models
por: Ling, Gui, et al.
Publicado: (2024)
por: Ling, Gui, et al.
Publicado: (2024)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
por: Wu, Yanan, et al.
Publicado: (2024)
por: Wu, Yanan, et al.
Publicado: (2024)
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
por: Cheng, Shuang, et al.
Publicado: (2025)
por: Cheng, Shuang, et al.
Publicado: (2025)
A Language-Signal-Vision Multimodal Framework for Multitask Cardiac Analysis
por: Zhang, Yuting, et al.
Publicado: (2025)
por: Zhang, Yuting, et al.
Publicado: (2025)
Layer-wise Positional Bias in Short-Context Language Modeling
por: Rahimi, Maryam, et al.
Publicado: (2026)
por: Rahimi, Maryam, et al.
Publicado: (2026)
A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning
por: Zang, Zelin, et al.
Publicado: (2025)
por: Zang, Zelin, et al.
Publicado: (2025)
Multi-Scale Manifold Alignment for Interpreting Large Language Models: A Unified Information-Geometric Framework
por: Zhang, Yukun, et al.
Publicado: (2025)
por: Zhang, Yukun, et al.
Publicado: (2025)
A Novel Multimodal RUL Framework for Remaining Useful Life Estimation with Layer-wise Explanations
por: Razzaq, Waleed, et al.
Publicado: (2025)
por: Razzaq, Waleed, et al.
Publicado: (2025)
LegalReasoner: Step-wised Verification-Correction for Legal Judgment Reasoning
por: Shi, Weijie, et al.
Publicado: (2025)
por: Shi, Weijie, et al.
Publicado: (2025)
Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language Models
por: Wu, Jialiang, et al.
Publicado: (2025)
por: Wu, Jialiang, et al.
Publicado: (2025)
Corrupted by Reasoning: Reasoning Language Models Become Free-Riders in Public Goods Games
por: Piedrahita, David Guzman, et al.
Publicado: (2025)
por: Piedrahita, David Guzman, et al.
Publicado: (2025)
Information-Theoretic Constraints for Continual Vision-Language-Action Alignment
por: Zhao, Libang, et al.
Publicado: (2026)
por: Zhao, Libang, et al.
Publicado: (2026)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
Jailbreaks on Vision Language Model via Multimodal Reasoning
por: Noheria, Aarush, et al.
Publicado: (2026)
por: Noheria, Aarush, et al.
Publicado: (2026)
DeepVIS: Bridging Natural Language and Data Visualization Through Step-wise Reasoning
por: Shuai, Zhihao, et al.
Publicado: (2025)
por: Shuai, Zhihao, et al.
Publicado: (2025)
Rule Encoding and Compliance in Large Language Models: An Information-Theoretic Analysis
por: Diederich, Joachim
Publicado: (2025)
por: Diederich, Joachim
Publicado: (2025)
A Measure-Theoretic Analysis of Reasoning: Structural Generalization and Approximation Limits
por: Zhang, Yuyang, et al.
Publicado: (2026)
por: Zhang, Yuyang, et al.
Publicado: (2026)
Think or Not? Exploring Thinking Efficiency in Large Reasoning Models via an Information-Theoretic Lens
por: Yong, Xixian, et al.
Publicado: (2025)
por: Yong, Xixian, et al.
Publicado: (2025)
Smart Vision-Language Reasoners
por: Roberts, Denisa, et al.
Publicado: (2024)
por: Roberts, Denisa, et al.
Publicado: (2024)
Bridging the Gap in Ophthalmic AI: MM-Retinal-Reason Dataset and OphthaReason Model toward Dynamic Multimodal Reasoning
por: Wu, Ruiqi, et al.
Publicado: (2025)
por: Wu, Ruiqi, et al.
Publicado: (2025)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
por: Zhang, Yinghui, et al.
Publicado: (2025)
por: Zhang, Yinghui, et al.
Publicado: (2025)
RAG-R1: Incentivizing the Search and Reasoning Capabilities of LLMs through Multi-query Parallelism
por: Tan, Zhiwen, et al.
Publicado: (2025)
por: Tan, Zhiwen, et al.
Publicado: (2025)
Continuous Reasoning for Vision-Language-Action
por: Wu, Yueh-Hua, et al.
Publicado: (2026)
por: Wu, Yueh-Hua, et al.
Publicado: (2026)
DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
por: Mo, Yunxiang, et al.
Publicado: (2025)
por: Mo, Yunxiang, et al.
Publicado: (2025)
Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data
por: Liu, Xiao, et al.
Publicado: (2024)
por: Liu, Xiao, et al.
Publicado: (2024)
Ejemplares similares
-
Continuous-Time Attention: PDE-Guided Mechanisms for Long-Sequence Transformers
por: Zhang, Yukun, et al.
Publicado: (2025) -
Where to Add PDE Diffusion in Transformers
por: Zhang, Yukun, et al.
Publicado: (2025) -
Understanding Transformer Architecture through Continuous Dynamics: A Partial Differential Equation Perspective
por: Zhang, Yukun, et al.
Publicado: (2024) -
Information-Theoretic Greedy Layer-wise Training for Traffic Sign Recognition
por: Lyu, Shuyan, et al.
Publicado: (2025) -
How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
por: Li, Ming, et al.
Publicado: (2025)