Salvato in:
| Autori principali: | Cui, Fangming, Fong, Jan, Zeng, Rongfei, Tian, Xinmei, Yu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.14376 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Target-unspecific Tasks through a Features Matrix
di: Cui, Fangming, et al.
Pubblicazione: (2025)
di: Cui, Fangming, et al.
Pubblicazione: (2025)
Advancing Prompt Learning through an External Layer
di: Cui, Fangming, et al.
Pubblicazione: (2024)
di: Cui, Fangming, et al.
Pubblicazione: (2024)
Generalizable Prompt Learning of CLIP: A Brief Overview
di: Cui, Fangming, et al.
Pubblicazione: (2025)
di: Cui, Fangming, et al.
Pubblicazione: (2025)
Mask the Target: A Plug-and-Play Regularizer Against LoRA Forgetting
di: Xu, Runze, et al.
Pubblicazione: (2026)
di: Xu, Runze, et al.
Pubblicazione: (2026)
Fine-tuning MLLMs Without Forgetting Is Easier Than You Think
di: Li, He, et al.
Pubblicazione: (2026)
di: Li, He, et al.
Pubblicazione: (2026)
Textual Inversion for Efficient Adaptation of Open-Vocabulary Object Detectors Without Forgetting
di: Ruis, Frank, et al.
Pubblicazione: (2025)
di: Ruis, Frank, et al.
Pubblicazione: (2025)
Semantic Textual Similarity Assessment in Chest X-ray Reports Using a Domain-Specific Cosine-Based Metric
di: Picha, Sayeh Gholipour, et al.
Pubblicazione: (2024)
di: Picha, Sayeh Gholipour, et al.
Pubblicazione: (2024)
Linking Representations with Multimodal Contrastive Learning
di: Arora, Abhishek, et al.
Pubblicazione: (2023)
di: Arora, Abhishek, et al.
Pubblicazione: (2023)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
CLEAR: Character Unlearning in Textual and Visual Modalities
di: Dontsov, Alexey, et al.
Pubblicazione: (2024)
di: Dontsov, Alexey, et al.
Pubblicazione: (2024)
Beyond the Textual: Generating Coherent Visual Options for MCQs
di: Wang, Wanqiang, et al.
Pubblicazione: (2025)
di: Wang, Wanqiang, et al.
Pubblicazione: (2025)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
di: Gordon, Brian, et al.
Pubblicazione: (2023)
di: Gordon, Brian, et al.
Pubblicazione: (2023)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
On the Risk of Misleading Reports: Diagnosing Textual Biases in Multimodal Clinical AI
di: Restrepo, David, et al.
Pubblicazione: (2025)
di: Restrepo, David, et al.
Pubblicazione: (2025)
TRACE: Textual Relevance Augmentation and Contextual Encoding for Multimodal Hate Detection
di: Koushik, Girish A., et al.
Pubblicazione: (2025)
di: Koushik, Girish A., et al.
Pubblicazione: (2025)
Tell Me What's Next: Textual Foresight for Generic UI Representations
di: Burns, Andrea, et al.
Pubblicazione: (2024)
di: Burns, Andrea, et al.
Pubblicazione: (2024)
Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions
di: Pi, Renjie, et al.
Pubblicazione: (2024)
di: Pi, Renjie, et al.
Pubblicazione: (2024)
Hierarchical Textual Knowledge for Enhanced Image Clustering
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
di: Li, Shuang, et al.
Pubblicazione: (2024)
di: Li, Shuang, et al.
Pubblicazione: (2024)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval
di: Sun, Hao, et al.
Pubblicazione: (2026)
di: Sun, Hao, et al.
Pubblicazione: (2026)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
di: Ye, Jinlun, et al.
Pubblicazione: (2026)
di: Ye, Jinlun, et al.
Pubblicazione: (2026)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites
di: Islam, Md. Adnanul, et al.
Pubblicazione: (2025)
di: Islam, Md. Adnanul, et al.
Pubblicazione: (2025)
Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2024)
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2024)
VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
di: Su, Hung-Ting, et al.
Pubblicazione: (2026)
di: Su, Hung-Ting, et al.
Pubblicazione: (2026)
Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs
di: Liang, Jiafeng, et al.
Pubblicazione: (2026)
di: Liang, Jiafeng, et al.
Pubblicazione: (2026)
FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions
di: Qin, Bowen, et al.
Pubblicazione: (2025)
di: Qin, Bowen, et al.
Pubblicazione: (2025)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
di: Azadani, Mozhgan Nasr, et al.
Pubblicazione: (2025)
di: Azadani, Mozhgan Nasr, et al.
Pubblicazione: (2025)
Beyond Meme Templates: Limitations of Visual Similarity Measures in Meme Matching
di: Hazman, Muzhaffar, et al.
Pubblicazione: (2025)
di: Hazman, Muzhaffar, et al.
Pubblicazione: (2025)
CAST: Cross-modal Alignment Similarity Test for Vision Language Models
di: Dagan, Gautier, et al.
Pubblicazione: (2024)
di: Dagan, Gautier, et al.
Pubblicazione: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
Efficient Personalized Text-to-image Generation by Leveraging Textual Subspace
di: Du, Shian, et al.
Pubblicazione: (2024)
di: Du, Shian, et al.
Pubblicazione: (2024)
Similarity Guided Multimodal Fusion Transformer for Semantic Location Prediction in Social Media
di: Zhang, Zhizhen, et al.
Pubblicazione: (2024)
di: Zhang, Zhizhen, et al.
Pubblicazione: (2024)
Prompting Forgetting: Unlearning in GANs via Textual Guidance
di: Nagasubramaniam, Piyush, et al.
Pubblicazione: (2025)
di: Nagasubramaniam, Piyush, et al.
Pubblicazione: (2025)
PUMGPT: A Large Vision-Language Model for Product Understanding
di: Xue, Wei, et al.
Pubblicazione: (2023)
di: Xue, Wei, et al.
Pubblicazione: (2023)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Target-unspecific Tasks through a Features Matrix
di: Cui, Fangming, et al.
Pubblicazione: (2025) -
Advancing Prompt Learning through an External Layer
di: Cui, Fangming, et al.
Pubblicazione: (2024) -
Generalizable Prompt Learning of CLIP: A Brief Overview
di: Cui, Fangming, et al.
Pubblicazione: (2025) -
Mask the Target: A Plug-and-Play Regularizer Against LoRA Forgetting
di: Xu, Runze, et al.
Pubblicazione: (2026) -
Fine-tuning MLLMs Without Forgetting Is Easier Than You Think
di: Li, He, et al.
Pubblicazione: (2026)