Turning Internal Gap into Self-Improvement: Promoting the Generation-Understanding Unification in MLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Yujin, Chen, Hao, Han, Andi, Wang, Zhiheng, Liu, Xinyu, Zhang, Yingya, Zhang, Shiwei, Zou, Difan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
par: Chen, Xingwu, et autres
Publié: (2026)
par: Chen, Xingwu, et autres
Publié: (2026)
Beyond Surface Structure: A Causal Assessment of LLMs' Comprehension Ability
par: Han, Yujin, et autres
Publié: (2024)
par: Han, Yujin, et autres
Publié: (2024)
Can Diffusion Models Learn Hidden Inter-Feature Rules Behind Images?
par: Han, Yujin, et autres
Publié: (2025)
par: Han, Yujin, et autres
Publié: (2025)
Understanding the Generalization of Stochastic Gradient Adam in Learning Neural Networks
par: Tang, Xuan, et autres
Publié: (2025)
par: Tang, Xuan, et autres
Publié: (2025)
Redundancy Principles for MLLMs Benchmarks
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
A Human-Like Reasoning Framework for Multi-Phases Planning Task with Large Language Models
par: Xie, Chengxing, et autres
Publié: (2024)
par: Xie, Chengxing, et autres
Publié: (2024)
Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller
par: Cai, Min, et autres
Publié: (2024)
par: Cai, Min, et autres
Publié: (2024)
Improving Group Robustness on Spurious Correlation Requires Preciser Group Inference
par: Han, Yujin, et autres
Publié: (2024)
par: Han, Yujin, et autres
Publié: (2024)
Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs
par: Ye, Hengwei, et autres
Publié: (2026)
par: Ye, Hengwei, et autres
Publié: (2026)
Can MLLMs Understand the Deep Implication Behind Chinese Images?
par: Zhang, Chenhao, et autres
Publié: (2024)
par: Zhang, Chenhao, et autres
Publié: (2024)
On the Robustness of Transformers against Context Hijacking for Linear Classification
par: Li, Tianle, et autres
Publié: (2025)
par: Li, Tianle, et autres
Publié: (2025)
AesRM: Improving Video Aesthetics with Expert-Level Feedback
par: Han, Yujin, et autres
Publié: (2026)
par: Han, Yujin, et autres
Publié: (2026)
Evaluation of Retrieval-Augmented Generation: A Survey
par: Yu, Hao, et autres
Publié: (2024)
par: Yu, Hao, et autres
Publié: (2024)
Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models
par: Gu, Xiaojie, et autres
Publié: (2026)
par: Gu, Xiaojie, et autres
Publié: (2026)
Beyond the Rosetta Stone: Unification Forces in Generalization Dynamics
par: Blum, Carter, et autres
Publié: (2025)
par: Blum, Carter, et autres
Publié: (2025)
PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuning
par: Zou, Jiaru, et autres
Publié: (2024)
par: Zou, Jiaru, et autres
Publié: (2024)
Towards Understanding Fine-Tuning Mechanisms of LLMs via Circuit Analysis
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
SPIN: Sparsifying and Integrating Internal Neurons in Large Language Models for Text Classification
par: Jiao, Difan, et autres
Publié: (2023)
par: Jiao, Difan, et autres
Publié: (2023)
Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling
par: Ding, Yiwen, et autres
Publié: (2024)
par: Ding, Yiwen, et autres
Publié: (2024)
InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning
par: Liu, Zeyu, et autres
Publié: (2025)
par: Liu, Zeyu, et autres
Publié: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Contrastive Identification and Generation in the Limit
par: Li, Xiaoyu, et autres
Publié: (2026)
par: Li, Xiaoyu, et autres
Publié: (2026)
Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective
par: Zhang, Zhihao, et autres
Publié: (2025)
par: Zhang, Zhihao, et autres
Publié: (2025)
DH-RAG: A Dynamic Historical Context-Powered Retrieval-Augmented Generation Method for Multi-Turn Dialogue
par: Zhang, Feiyuan, et autres
Publié: (2025)
par: Zhang, Feiyuan, et autres
Publié: (2025)
A Static and Dynamic Attention Framework for Multi Turn Dialogue Generation
par: Zhang, Wei-Nan, et autres
Publié: (2024)
par: Zhang, Wei-Nan, et autres
Publié: (2024)
Affordance Benchmark for MLLMs
par: Wang, Junying, et autres
Publié: (2025)
par: Wang, Junying, et autres
Publié: (2025)
TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs
par: Wang, Ziyi, et autres
Publié: (2026)
par: Wang, Ziyi, et autres
Publié: (2026)
Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding
par: Kawasaki, Haruka, et autres
Publié: (2026)
par: Kawasaki, Haruka, et autres
Publié: (2026)
Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
par: Wei, Yujie, et autres
Publié: (2025)
par: Wei, Yujie, et autres
Publié: (2025)
Identifying Task Groupings for Multi-Task Learning Using Pointwise V-Usable Information
par: Li, Yingya, et autres
Publié: (2024)
par: Li, Yingya, et autres
Publié: (2024)
CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language
par: Zhao, Rui, et autres
Publié: (2026)
par: Zhao, Rui, et autres
Publié: (2026)
Self-Training with Pseudo-Label Scorer for Aspect Sentiment Quad Prediction
par: Zhang, Yice, et autres
Publié: (2024)
par: Zhang, Yice, et autres
Publié: (2024)
Neural Attention Search
par: Deng, Difan, et autres
Publié: (2025)
par: Deng, Difan, et autres
Publié: (2025)
Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks
par: Jiang, Chunyang, et autres
Publié: (2025)
par: Jiang, Chunyang, et autres
Publié: (2025)
Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
Differentiable Evolutionary Reinforcement Learning
par: Cheng, Sitao, et autres
Publié: (2025)
par: Cheng, Sitao, et autres
Publié: (2025)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities
par: Jiang, Shixin, et autres
Publié: (2024)
par: Jiang, Shixin, et autres
Publié: (2024)
Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
par: Guo, Xin, et autres
Publié: (2025)
par: Guo, Xin, et autres
Publié: (2025)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
par: Sun, Xiongtao, et autres
Publié: (2024)
par: Sun, Xiongtao, et autres
Publié: (2024)
Documents similaires
-
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
par: Chen, Xingwu, et autres
Publié: (2026) -
Beyond Surface Structure: A Causal Assessment of LLMs' Comprehension Ability
par: Han, Yujin, et autres
Publié: (2024) -
Can Diffusion Models Learn Hidden Inter-Feature Rules Behind Images?
par: Han, Yujin, et autres
Publié: (2025) -
Understanding the Generalization of Stochastic Gradient Adam in Learning Neural Networks
par: Tang, Xuan, et autres
Publié: (2025) -
Redundancy Principles for MLLMs Benchmarks
par: Zhang, Zicheng, et autres
Publié: (2025)