Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Zhen, Gu, Leijiang, Yang, Xun, Duan, Zhangling, Shi, Zenglin, Wang, Meng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models
di: Gu, Leijiang, et al.
Pubblicazione: (2026)
di: Gu, Leijiang, et al.
Pubblicazione: (2026)
Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning
di: Zeng, Zhen, et al.
Pubblicazione: (2025)
di: Zeng, Zhen, et al.
Pubblicazione: (2025)
MultiModal Fine-tuning with Synthetic Captions
di: Enomoto, Shohei, et al.
Pubblicazione: (2026)
di: Enomoto, Shohei, et al.
Pubblicazione: (2026)
ControlEdit: A MultiModal Local Clothing Image Editing Method
di: Cheng, Di, et al.
Pubblicazione: (2024)
di: Cheng, Di, et al.
Pubblicazione: (2024)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
di: Qiu, Han, et al.
Pubblicazione: (2024)
di: Qiu, Han, et al.
Pubblicazione: (2024)
MMA-Diffusion: MultiModal Attack on Diffusion Models
di: Yang, Yijun, et al.
Pubblicazione: (2023)
di: Yang, Yijun, et al.
Pubblicazione: (2023)
MultiModal Action Conditioned Video Generation
di: Li, Yichen, et al.
Pubblicazione: (2025)
di: Li, Yichen, et al.
Pubblicazione: (2025)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
di: Yan, Bei, et al.
Pubblicazione: (2024)
di: Yan, Bei, et al.
Pubblicazione: (2024)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
di: Zou, Heqing, et al.
Pubblicazione: (2024)
di: Zou, Heqing, et al.
Pubblicazione: (2024)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
di: Ma, Lichen, et al.
Pubblicazione: (2024)
di: Ma, Lichen, et al.
Pubblicazione: (2024)
CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs
di: Zeng, Zhen, et al.
Pubblicazione: (2026)
di: Zeng, Zhen, et al.
Pubblicazione: (2026)
Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
di: Wang, Wei, et al.
Pubblicazione: (2024)
di: Wang, Wei, et al.
Pubblicazione: (2024)
M3: 3D-Spatial MultiModal Memory
di: Zou, Xueyan, et al.
Pubblicazione: (2025)
di: Zou, Xueyan, et al.
Pubblicazione: (2025)
MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings
di: Li, Zijie, et al.
Pubblicazione: (2026)
di: Li, Zijie, et al.
Pubblicazione: (2026)
ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology
di: Sastry, Srikumar, et al.
Pubblicazione: (2025)
di: Sastry, Srikumar, et al.
Pubblicazione: (2025)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
Re-M3Dr: Rebalanced MultiModal Mean Deviation Regression
di: Yin, Haojie, et al.
Pubblicazione: (2026)
di: Yin, Haojie, et al.
Pubblicazione: (2026)
CapS-Adapter: Caption-based MultiModal Adapter in Zero-Shot Classification
di: Wang, Qijie, et al.
Pubblicazione: (2024)
di: Wang, Qijie, et al.
Pubblicazione: (2024)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
M$^2$CD: A Unified MultiModal Framework for Optical-SAR Change Detection with Mixture of Experts and Self-Distillation
di: Liu, Ziyuan, et al.
Pubblicazione: (2025)
di: Liu, Ziyuan, et al.
Pubblicazione: (2025)
HAMMR: HierArchical MultiModal React agents for generic VQA
di: Castrejon, Lluis, et al.
Pubblicazione: (2024)
di: Castrejon, Lluis, et al.
Pubblicazione: (2024)
TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
di: Zheng, Xuhui, et al.
Pubblicazione: (2025)
di: Zheng, Xuhui, et al.
Pubblicazione: (2025)
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
di: Gao, Xin, et al.
Pubblicazione: (2026)
di: Gao, Xin, et al.
Pubblicazione: (2026)
Self-Adapting Large Visual-Language Models to Edge Devices across Visual Modalities
di: Cai, Kaiwen, et al.
Pubblicazione: (2024)
di: Cai, Kaiwen, et al.
Pubblicazione: (2024)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
Fine-Grained Human Pose Editing Assessment via Layer-Selective MLLMs
di: Sun, Ningyu, et al.
Pubblicazione: (2026)
di: Sun, Ningyu, et al.
Pubblicazione: (2026)
M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System
di: Kong, Chenqi, et al.
Pubblicazione: (2023)
di: Kong, Chenqi, et al.
Pubblicazione: (2023)
M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention
di: Panta, Sanjeev, et al.
Pubblicazione: (2026)
di: Panta, Sanjeev, et al.
Pubblicazione: (2026)
Audio-Guided Visual Editing with Complex Multi-Modal Prompts
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
MMA-DFER: MultiModal Adaptation of unimodal models for Dynamic Facial Expression Recognition in-the-wild
di: Chumachenko, Kateryna, et al.
Pubblicazione: (2024)
di: Chumachenko, Kateryna, et al.
Pubblicazione: (2024)
TimeMachine: Fine-Grained Facial Age Editing with Identity Preservation
di: Mi, Yilin, et al.
Pubblicazione: (2025)
di: Mi, Yilin, et al.
Pubblicazione: (2025)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
di: Wang, Yeyuan, et al.
Pubblicazione: (2024)
di: Wang, Yeyuan, et al.
Pubblicazione: (2024)
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
di: Xiao, Yicheng, et al.
Pubblicazione: (2026)
di: Xiao, Yicheng, et al.
Pubblicazione: (2026)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
di: Zhao, Fufangchen, et al.
Pubblicazione: (2025)
di: Zhao, Fufangchen, et al.
Pubblicazione: (2025)
Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions
di: Ma, Chenrui, et al.
Pubblicazione: (2025)
di: Ma, Chenrui, et al.
Pubblicazione: (2025)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
di: Leng, Sicong, et al.
Pubblicazione: (2024)
di: Leng, Sicong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models
di: Gu, Leijiang, et al.
Pubblicazione: (2026) -
Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning
di: Zeng, Zhen, et al.
Pubblicazione: (2025) -
MultiModal Fine-tuning with Synthetic Captions
di: Enomoto, Shohei, et al.
Pubblicazione: (2026) -
ControlEdit: A MultiModal Local Clothing Image Editing Method
di: Cheng, Di, et al.
Pubblicazione: (2024) -
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
di: Qiu, Han, et al.
Pubblicazione: (2024)