Probing and Inducing Combinational Creativity in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Peng, Yongqian, Ma, Yuxi, Wang, Mengmeng, Wang, Yuxuan, Wang, Yizhou, Zhang, Chi, Zhu, Yixin, Zheng, Zilong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
por: Wang, Zihu, et al.
Publicado: (2025)
por: Wang, Zihu, et al.
Publicado: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models
por: Zheng, Chen, et al.
Publicado: (2026)
por: Zheng, Chen, et al.
Publicado: (2026)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Dynamic Token Reweighting for Robust Vision-Language Models
por: Jiang, Tanqiu, et al.
Publicado: (2025)
por: Jiang, Tanqiu, et al.
Publicado: (2025)
v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
por: Shi, Zhengpeng, et al.
Publicado: (2025)
por: Shi, Zhengpeng, et al.
Publicado: (2025)
Inference Compute-Optimal Video Vision Language Models
por: Wang, Peiqi, et al.
Publicado: (2025)
por: Wang, Peiqi, et al.
Publicado: (2025)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
por: Wu, Xueqing, et al.
Publicado: (2026)
por: Wu, Xueqing, et al.
Publicado: (2026)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
por: Wang, Zehao, et al.
Publicado: (2024)
por: Wang, Zehao, et al.
Publicado: (2024)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
Evaluating Vision-Language Models for Emotion Recognition
por: Bhattacharyya, Sree, et al.
Publicado: (2025)
por: Bhattacharyya, Sree, et al.
Publicado: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
por: Zhu, Tinghui, et al.
Publicado: (2024)
por: Zhu, Tinghui, et al.
Publicado: (2024)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
por: Wang, Jun, et al.
Publicado: (2026)
por: Wang, Jun, et al.
Publicado: (2026)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
por: Wang, Shengkang, et al.
Publicado: (2024)
por: Wang, Shengkang, et al.
Publicado: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
por: Xue, Wei, et al.
Publicado: (2023)
por: Xue, Wei, et al.
Publicado: (2023)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
por: Wang, Weihang, et al.
Publicado: (2025)
por: Wang, Weihang, et al.
Publicado: (2025)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
Text Prompt Injection of Vision Language Models
por: Zhu, Ruizhe
Publicado: (2025)
por: Zhu, Ruizhe
Publicado: (2025)
Redefining <Creative> in Dictionary: Towards an Enhanced Semantic Understanding of Creative Generation
por: Feng, Fu, et al.
Publicado: (2024)
por: Feng, Fu, et al.
Publicado: (2024)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
Nodes Are Early, Edges Are Late: Probing Diagram Representations in Large Vision-Language Models
por: Yoshida, Haruto, et al.
Publicado: (2026)
por: Yoshida, Haruto, et al.
Publicado: (2026)
Visual In-Context Learning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
por: Li, Yanwei, et al.
Publicado: (2024)
por: Li, Yanwei, et al.
Publicado: (2024)
Towards Few-shot Entity Recognition in Document Images: A Graph Neural Network Approach Robust to Image Manipulation
por: Krishnan, Prashant, et al.
Publicado: (2023)
por: Krishnan, Prashant, et al.
Publicado: (2023)
Lifelong Knowledge Editing for Vision Language Models with Low-Rank Mixture-of-Experts
por: Chen, Qizhou, et al.
Publicado: (2024)
por: Chen, Qizhou, et al.
Publicado: (2024)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
por: Gao, Peng, et al.
Publicado: (2021)
por: Gao, Peng, et al.
Publicado: (2021)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
por: Yang, Xu, et al.
Publicado: (2023)
por: Yang, Xu, et al.
Publicado: (2023)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
por: Luo, Fuwen, et al.
Publicado: (2024)
por: Luo, Fuwen, et al.
Publicado: (2024)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
por: Chen, Yangyi, et al.
Publicado: (2024)
por: Chen, Yangyi, et al.
Publicado: (2024)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
por: You, Haoxuan, et al.
Publicado: (2023)
por: You, Haoxuan, et al.
Publicado: (2023)
Vision-centric Token Compression in Large Language Model
por: Xing, Ling, et al.
Publicado: (2025)
por: Xing, Ling, et al.
Publicado: (2025)
Attribution Analysis Meets Model Editing: Advancing Knowledge Correction in Vision Language Models with VisEdit
por: Chen, Qizhou, et al.
Publicado: (2024)
por: Chen, Qizhou, et al.
Publicado: (2024)
Trajectory Prediction Meets Large Language Models: A Survey
por: Xu, Yi, et al.
Publicado: (2025)
por: Xu, Yi, et al.
Publicado: (2025)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
por: Cai, Hengxing, et al.
Publicado: (2025)
por: Cai, Hengxing, et al.
Publicado: (2025)
Ejemplares similares
-
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
por: Wang, Zihu, et al.
Publicado: (2025) -
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
por: Wang, Yuxuan, et al.
Publicado: (2024) -
Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models
por: Zheng, Chen, et al.
Publicado: (2026) -
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
por: Wang, Yuxuan, et al.
Publicado: (2024) -
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
por: Li, Xiang, et al.
Publicado: (2024)