Probing and Inducing Combinational Creativity in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Yongqian, Ma, Yuxi, Wang, Mengmeng, Wang, Yuxuan, Wang, Yizhou, Zhang, Chi, Zhu, Yixin, Zheng, Zilong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
di: Wang, Zihu, et al.
Pubblicazione: (2025)
di: Wang, Zihu, et al.
Pubblicazione: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models
di: Zheng, Chen, et al.
Pubblicazione: (2026)
di: Zheng, Chen, et al.
Pubblicazione: (2026)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Dynamic Token Reweighting for Robust Vision-Language Models
di: Jiang, Tanqiu, et al.
Pubblicazione: (2025)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2025)
v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
di: Shi, Zhengpeng, et al.
Pubblicazione: (2025)
di: Shi, Zhengpeng, et al.
Pubblicazione: (2025)
Inference Compute-Optimal Video Vision Language Models
di: Wang, Peiqi, et al.
Pubblicazione: (2025)
di: Wang, Peiqi, et al.
Pubblicazione: (2025)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
di: Wang, Zehao, et al.
Pubblicazione: (2024)
di: Wang, Zehao, et al.
Pubblicazione: (2024)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
Evaluating Vision-Language Models for Emotion Recognition
di: Bhattacharyya, Sree, et al.
Pubblicazione: (2025)
di: Bhattacharyya, Sree, et al.
Pubblicazione: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
di: Wang, Shengkang, et al.
Pubblicazione: (2024)
di: Wang, Shengkang, et al.
Pubblicazione: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
di: Xue, Wei, et al.
Pubblicazione: (2023)
di: Xue, Wei, et al.
Pubblicazione: (2023)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
di: Wang, Weihang, et al.
Pubblicazione: (2025)
di: Wang, Weihang, et al.
Pubblicazione: (2025)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
di: Gu, Jihao, et al.
Pubblicazione: (2025)
di: Gu, Jihao, et al.
Pubblicazione: (2025)
Text Prompt Injection of Vision Language Models
di: Zhu, Ruizhe
Pubblicazione: (2025)
di: Zhu, Ruizhe
Pubblicazione: (2025)
Redefining <Creative> in Dictionary: Towards an Enhanced Semantic Understanding of Creative Generation
di: Feng, Fu, et al.
Pubblicazione: (2024)
di: Feng, Fu, et al.
Pubblicazione: (2024)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
Nodes Are Early, Edges Are Late: Probing Diagram Representations in Large Vision-Language Models
di: Yoshida, Haruto, et al.
Pubblicazione: (2026)
di: Yoshida, Haruto, et al.
Pubblicazione: (2026)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
di: Li, Yanwei, et al.
Pubblicazione: (2024)
di: Li, Yanwei, et al.
Pubblicazione: (2024)
Towards Few-shot Entity Recognition in Document Images: A Graph Neural Network Approach Robust to Image Manipulation
di: Krishnan, Prashant, et al.
Pubblicazione: (2023)
di: Krishnan, Prashant, et al.
Pubblicazione: (2023)
Lifelong Knowledge Editing for Vision Language Models with Low-Rank Mixture-of-Experts
di: Chen, Qizhou, et al.
Pubblicazione: (2024)
di: Chen, Qizhou, et al.
Pubblicazione: (2024)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
di: Gao, Peng, et al.
Pubblicazione: (2021)
di: Gao, Peng, et al.
Pubblicazione: (2021)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
di: Yang, Xu, et al.
Pubblicazione: (2023)
di: Yang, Xu, et al.
Pubblicazione: (2023)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
di: You, Haoxuan, et al.
Pubblicazione: (2023)
di: You, Haoxuan, et al.
Pubblicazione: (2023)
Vision-centric Token Compression in Large Language Model
di: Xing, Ling, et al.
Pubblicazione: (2025)
di: Xing, Ling, et al.
Pubblicazione: (2025)
Attribution Analysis Meets Model Editing: Advancing Knowledge Correction in Vision Language Models with VisEdit
di: Chen, Qizhou, et al.
Pubblicazione: (2024)
di: Chen, Qizhou, et al.
Pubblicazione: (2024)
Trajectory Prediction Meets Large Language Models: A Survey
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
di: Cai, Hengxing, et al.
Pubblicazione: (2025)
di: Cai, Hengxing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
di: Wang, Zihu, et al.
Pubblicazione: (2025) -
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
di: Wang, Yuxuan, et al.
Pubblicazione: (2024) -
Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models
di: Zheng, Chen, et al.
Pubblicazione: (2026) -
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
di: Wang, Yuxuan, et al.
Pubblicazione: (2024) -
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
di: Li, Xiang, et al.
Pubblicazione: (2024)