Joint Visual and Text Prompting for Improved Object-Centric Perception with Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Songtao, Zhang, Yan, Zhou, Chenyi, Jin, Yeying, Feng, Yang, Wu, Jian, Liu, Zuozhu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering
por: Jiang, Songtao, et al.
Publicado: (2025)
por: Jiang, Songtao, et al.
Publicado: (2025)
Knowing or Guessing? Robust Medical Visual Question Answering via Joint Consistency and Contrastive Learning
por: Jiang, Songtao, et al.
Publicado: (2025)
por: Jiang, Songtao, et al.
Publicado: (2025)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
por: Jiang, Songtao, et al.
Publicado: (2025)
por: Jiang, Songtao, et al.
Publicado: (2025)
Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models
por: Jiang, Songtao, et al.
Publicado: (2024)
por: Jiang, Songtao, et al.
Publicado: (2024)
OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding
por: Jiang, Songtao, et al.
Publicado: (2025)
por: Jiang, Songtao, et al.
Publicado: (2025)
Large Language Models Meet Text-Centric Multimodal Sentiment Analysis: A Survey
por: Yang, Hao, et al.
Publicado: (2024)
por: Yang, Hao, et al.
Publicado: (2024)
Self-Improving for Zero-Shot Named Entity Recognition with Large Language Models
por: Xie, Tingyu, et al.
Publicado: (2023)
por: Xie, Tingyu, et al.
Publicado: (2023)
MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale
por: Gai, Xiaotang, et al.
Publicado: (2024)
por: Gai, Xiaotang, et al.
Publicado: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
Persona-judge: Personalized Alignment of Large Language Models via Token-level Self-judgment
por: Zhang, Xiaotian, et al.
Publicado: (2025)
por: Zhang, Xiaotian, et al.
Publicado: (2025)
Modality-Fair Preference Optimization for Trustworthy MLLM Alignment
por: Jiang, Songtao, et al.
Publicado: (2024)
por: Jiang, Songtao, et al.
Publicado: (2024)
PACE: Improving Prompt with Actor-Critic Editing for Large Language Model
por: Dong, Yihong, et al.
Publicado: (2023)
por: Dong, Yihong, et al.
Publicado: (2023)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
por: Zhou, Qiji, et al.
Publicado: (2024)
por: Zhou, Qiji, et al.
Publicado: (2024)
When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models
por: Wu, Huyu, et al.
Publicado: (2025)
por: Wu, Huyu, et al.
Publicado: (2025)
Identifying and Mitigating Social Bias Knowledge in Language Models
por: Chen, Ruizhe, et al.
Publicado: (2024)
por: Chen, Ruizhe, et al.
Publicado: (2024)
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
por: Chen, Feng, et al.
Publicado: (2024)
por: Chen, Feng, et al.
Publicado: (2024)
Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
por: Zhang, Juntian, et al.
Publicado: (2025)
por: Zhang, Juntian, et al.
Publicado: (2025)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
por: Fan, Zhiting, et al.
Publicado: (2025)
por: Fan, Zhiting, et al.
Publicado: (2025)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
por: Woo, Sangmin, et al.
Publicado: (2025)
por: Woo, Sangmin, et al.
Publicado: (2025)
Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models
por: Mu, Yongyu, et al.
Publicado: (2025)
por: Mu, Yongyu, et al.
Publicado: (2025)
Improving Large Language Models for Clinical Named Entity Recognition via Prompt Engineering
por: Hu, Yan, et al.
Publicado: (2023)
por: Hu, Yan, et al.
Publicado: (2023)
Improving Text Embeddings with Large Language Models
por: Wang, Liang, et al.
Publicado: (2023)
por: Wang, Liang, et al.
Publicado: (2023)
TEaR: Improving LLM-based Machine Translation with Systematic Self-Refinement
por: Feng, Zhaopeng, et al.
Publicado: (2024)
por: Feng, Zhaopeng, et al.
Publicado: (2024)
On the (In)Effectiveness of Large Language Models for Chinese Text Correction
por: Li, Yinghui, et al.
Publicado: (2023)
por: Li, Yinghui, et al.
Publicado: (2023)
Hypothesis Testing Prompting Improves Deductive Reasoning in Large Language Models
por: Li, Yitian, et al.
Publicado: (2024)
por: Li, Yitian, et al.
Publicado: (2024)
Learnable Privacy Neurons Localization in Language Models
por: Chen, Ruizhe, et al.
Publicado: (2024)
por: Chen, Ruizhe, et al.
Publicado: (2024)
GePBench: Evaluating Fundamental Geometric Perception for Multimodal Large Language Models
por: Xing, Shangyu, et al.
Publicado: (2024)
por: Xing, Shangyu, et al.
Publicado: (2024)
Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models
por: Yang, Jingyuan, et al.
Publicado: (2025)
por: Yang, Jingyuan, et al.
Publicado: (2025)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
por: Lin, Yuanze, et al.
Publicado: (2024)
por: Lin, Yuanze, et al.
Publicado: (2024)
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
por: Jiang, Yilei, et al.
Publicado: (2024)
por: Jiang, Yilei, et al.
Publicado: (2024)
Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting
por: Qin, Zhen, et al.
Publicado: (2023)
por: Qin, Zhen, et al.
Publicado: (2023)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
por: Wu, Jiulong, et al.
Publicado: (2025)
por: Wu, Jiulong, et al.
Publicado: (2025)
A Human-Centric Pipeline for Aligning Large Language Models with Chinese Medical Ethics
por: Jin, Haoan, et al.
Publicado: (2026)
por: Jin, Haoan, et al.
Publicado: (2026)
DynaThink: Fast or Slow? A Dynamic Decision-Making Framework for Large Language Models
por: Pan, Jiabao, et al.
Publicado: (2024)
por: Pan, Jiabao, et al.
Publicado: (2024)
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
por: Cheng, Xianfu, et al.
Publicado: (2025)
por: Cheng, Xianfu, et al.
Publicado: (2025)
Prompt Stability Scoring for Text Annotation with Large Language Models
por: Barrie, Christopher, et al.
Publicado: (2024)
por: Barrie, Christopher, et al.
Publicado: (2024)
Private Text Generation by Seeding Large Language Model Prompts
por: Nagesh, Supriya, et al.
Publicado: (2025)
por: Nagesh, Supriya, et al.
Publicado: (2025)
Large Language Model Bias Mitigation from the Perspective of Knowledge Editing
por: Chen, Ruizhe, et al.
Publicado: (2024)
por: Chen, Ruizhe, et al.
Publicado: (2024)
OCALM: Object-Centric Assessment with Language Models
por: Kaufmann, Timo, et al.
Publicado: (2024)
por: Kaufmann, Timo, et al.
Publicado: (2024)
Evaluating and Improving Graph to Text Generation with Large Language Models
por: He, Jie, et al.
Publicado: (2025)
por: He, Jie, et al.
Publicado: (2025)
Ejemplares similares
-
Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering
por: Jiang, Songtao, et al.
Publicado: (2025) -
Knowing or Guessing? Robust Medical Visual Question Answering via Joint Consistency and Contrastive Learning
por: Jiang, Songtao, et al.
Publicado: (2025) -
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
por: Jiang, Songtao, et al.
Publicado: (2025) -
Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models
por: Jiang, Songtao, et al.
Publicado: (2024) -
OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding
por: Jiang, Songtao, et al.
Publicado: (2025)