M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yanshu, Cao, Yi, He, Hongyang, Cheng, Qisen, Fu, Xiang, Xiao, Xi, Wang, Tianyang, Tang, Ruixiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning
di: Li, Yanshu, et al.
Pubblicazione: (2025)
di: Li, Yanshu, et al.
Pubblicazione: (2025)
Towards Generalizable Implicit In-Context Learning with Attention Routing
di: Li, Jiaqian, et al.
Pubblicazione: (2025)
di: Li, Jiaqian, et al.
Pubblicazione: (2025)
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
di: Li, Yanshu, et al.
Pubblicazione: (2025)
di: Li, Yanshu, et al.
Pubblicazione: (2025)
TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration
di: Li, Yanshu, et al.
Pubblicazione: (2025)
di: Li, Yanshu, et al.
Pubblicazione: (2025)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
di: Li, Yanshu
Pubblicazione: (2025)
di: Li, Yanshu
Pubblicazione: (2025)
TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling
di: Li, Jiaqian, et al.
Pubblicazione: (2026)
di: Li, Jiaqian, et al.
Pubblicazione: (2026)
Enhancing Fine-grained Object Detection in Aerial Images via Orthogonal Mapping
di: Zhu, Haoran, et al.
Pubblicazione: (2024)
di: Zhu, Haoran, et al.
Pubblicazione: (2024)
Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions
di: Ma, Chenrui, et al.
Pubblicazione: (2025)
di: Ma, Chenrui, et al.
Pubblicazione: (2025)
SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models
di: Yi, Huahui, et al.
Pubblicazione: (2025)
di: Yi, Huahui, et al.
Pubblicazione: (2025)
Learning Unsupervised Semantic Document Representation for Fine-grained Aspect-based Sentiment Analysis
di: Fu, Hao-Ming, et al.
Pubblicazione: (2024)
di: Fu, Hao-Ming, et al.
Pubblicazione: (2024)
When Reward Hacking Rebounds: Understanding and Mitigating It with Representation-Level Signals
di: Wu, Rui, et al.
Pubblicazione: (2026)
di: Wu, Rui, et al.
Pubblicazione: (2026)
Read the Scene, Not the Script: Outcome-Aware Safety for LLMs
di: Wu, Rui, et al.
Pubblicazione: (2025)
di: Wu, Rui, et al.
Pubblicazione: (2025)
M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks
di: Zeng, Yongjie, et al.
Pubblicazione: (2025)
di: Zeng, Yongjie, et al.
Pubblicazione: (2025)
Not All Directions Matter: Towards Structured and Task-Aware Low-Rank Model Adaptation
di: Xiao, Xi, et al.
Pubblicazione: (2026)
di: Xiao, Xi, et al.
Pubblicazione: (2026)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
TokenSeek: Memory Efficient Fine Tuning via Instance-Aware Token Ditching
di: Zeng, Runjia, et al.
Pubblicazione: (2026)
di: Zeng, Runjia, et al.
Pubblicazione: (2026)
Fine-grained Image Retrieval via Dual-Vision Adaptation
di: Jiang, Xin, et al.
Pubblicazione: (2025)
di: Jiang, Xin, et al.
Pubblicazione: (2025)
Towards Efficient and Effective Text-to-Video Retrieval with Coarse-to-Fine Visual Representation Learning
di: Tian, Kaibin, et al.
Pubblicazione: (2024)
di: Tian, Kaibin, et al.
Pubblicazione: (2024)
CulFiT: A Fine-grained Cultural-aware LLM Training Paradigm via Multilingual Critique Data Synthesis
di: Feng, Ruixiang, et al.
Pubblicazione: (2025)
di: Feng, Ruixiang, et al.
Pubblicazione: (2025)
Identity-Aware U-Net: Fine-grained Cell Segmentation via Identity-Aware Representation Learning
di: Xiao, Rui
Pubblicazione: (2026)
di: Xiao, Rui
Pubblicazione: (2026)
Multimodal Fine-grained Reasoning for Post Quality Evaluation
di: Guo, Xiaoxu, et al.
Pubblicazione: (2025)
di: Guo, Xiaoxu, et al.
Pubblicazione: (2025)
Multimodal Fine-grained Context Interaction Graph Modeling for Conversational Speech Synthesis
di: Jia, Zhenqi, et al.
Pubblicazione: (2025)
di: Jia, Zhenqi, et al.
Pubblicazione: (2025)
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
di: Yang, Jianjiang, et al.
Pubblicazione: (2025)
di: Yang, Jianjiang, et al.
Pubblicazione: (2025)
Towards Context-Robust LLMs: A Gated Representation Fine-tuning Approach
di: Zeng, Shenglai, et al.
Pubblicazione: (2025)
di: Zeng, Shenglai, et al.
Pubblicazione: (2025)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
di: Chen, Shunian, et al.
Pubblicazione: (2025)
di: Chen, Shunian, et al.
Pubblicazione: (2025)
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
Self-Supervised Visual Prompting for Cross-Domain Road Damage Detection
di: Xiao, Xi, et al.
Pubblicazione: (2025)
di: Xiao, Xi, et al.
Pubblicazione: (2025)
Accessible Fine-grained Data Representation via Spatial Audio
di: Liu, Can, et al.
Pubblicazione: (2026)
di: Liu, Can, et al.
Pubblicazione: (2026)
EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment
di: Cheng, Chunyang, et al.
Pubblicazione: (2026)
di: Cheng, Chunyang, et al.
Pubblicazione: (2026)
Wavelet-Driven Masked Image Modeling: A Path to Efficient Visual Representation
di: Xiang, Wenzhao, et al.
Pubblicazione: (2025)
di: Xiang, Wenzhao, et al.
Pubblicazione: (2025)
FLAIR: VLM with Fine-grained Language-informed Image Representations
di: Xiao, Rui, et al.
Pubblicazione: (2024)
di: Xiao, Rui, et al.
Pubblicazione: (2024)
Self-Constructed Context Decompilation with Fined-grained Alignment Enhancement
di: Feng, Yunlong, et al.
Pubblicazione: (2024)
di: Feng, Yunlong, et al.
Pubblicazione: (2024)
Tokenization, Fusion, and Augmentation: Towards Fine-grained Multi-modal Entity Representation
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
Learning Straight Flows: Variational Flow Matching for Efficient Generation
di: Ma, Chenrui, et al.
Pubblicazione: (2025)
di: Ma, Chenrui, et al.
Pubblicazione: (2025)
MolReFlect: Towards In-Context Fine-grained Alignments between Molecules and Texts
di: Li, Jiatong, et al.
Pubblicazione: (2024)
di: Li, Jiatong, et al.
Pubblicazione: (2024)
MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion
di: Jiang, Ruixiang, et al.
Pubblicazione: (2024)
di: Jiang, Ruixiang, et al.
Pubblicazione: (2024)
LDP: Parameter-Efficient Fine-Tuning of Multimodal LLM for Medical Report Generation
di: Zhou, Tianyu, et al.
Pubblicazione: (2025)
di: Zhou, Tianyu, et al.
Pubblicazione: (2025)
ContextNav: Towards Agentic Multimodal In-Context Learning
di: Fu, Honghao, et al.
Pubblicazione: (2025)
di: Fu, Honghao, et al.
Pubblicazione: (2025)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
Unifying Prediction and Explanation in Time-Series Transformers via Shapley-based Pretraining
di: Cheng, Qisen, et al.
Pubblicazione: (2025)
di: Cheng, Qisen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning
di: Li, Yanshu, et al.
Pubblicazione: (2025) -
Towards Generalizable Implicit In-Context Learning with Attention Routing
di: Li, Jiaqian, et al.
Pubblicazione: (2025) -
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
di: Li, Yanshu, et al.
Pubblicazione: (2025) -
TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration
di: Li, Yanshu, et al.
Pubblicazione: (2025) -
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
di: Li, Yanshu
Pubblicazione: (2025)