A Computational Approach to Visual Metonymy
Fuente:
arXiv
Salvato in:
| Autori principali: | Ghosh, Saptarshi, Liu, Linfeng, Jiang, Tianyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MetFuse: Figurative Fusion between Metonymy and Metaphor
di: Ghosh, Saptarshi, et al.
Pubblicazione: (2026)
di: Ghosh, Saptarshi, et al.
Pubblicazione: (2026)
ConMeC: A Dataset for Metonymy Resolution with Common Nouns
di: Ghosh, Saptarshi, et al.
Pubblicazione: (2025)
di: Ghosh, Saptarshi, et al.
Pubblicazione: (2025)
Towards Robust Evaluation of Visual Activity Recognition: Resolving Verb Ambiguity with Sense Clustering
di: Yao, Louie Hong, et al.
Pubblicazione: (2025)
di: Yao, Louie Hong, et al.
Pubblicazione: (2025)
Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
Evaluating the Impact of Verbal Multiword Expressions on Machine Translation
di: Liu, Linfeng, et al.
Pubblicazione: (2025)
di: Liu, Linfeng, et al.
Pubblicazione: (2025)
Metonymy in vision models undermines attention-based interpretability
di: Aniraj, Ananthu, et al.
Pubblicazione: (2026)
di: Aniraj, Ananthu, et al.
Pubblicazione: (2026)
Latent Visual Reasoning
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
di: Wang, Tianyu, et al.
Pubblicazione: (2024)
di: Wang, Tianyu, et al.
Pubblicazione: (2024)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
di: Li, Shuang, et al.
Pubblicazione: (2024)
di: Li, Shuang, et al.
Pubblicazione: (2024)
Anatomy of a Feeling: Narrating Embodied Emotions via Large Vision-Language Models
di: Saim, Mohammad, et al.
Pubblicazione: (2025)
di: Saim, Mohammad, et al.
Pubblicazione: (2025)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
Visually Guided Generative Text-Layout Pre-training for Document Intelligence
di: Mao, Zhiming, et al.
Pubblicazione: (2024)
di: Mao, Zhiming, et al.
Pubblicazione: (2024)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
di: Dai, Yifan, et al.
Pubblicazione: (2026)
di: Dai, Yifan, et al.
Pubblicazione: (2026)
Reinforcing Multimodal Reasoning Against Visual Degradation
di: Liu, Rui, et al.
Pubblicazione: (2026)
di: Liu, Rui, et al.
Pubblicazione: (2026)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
di: Chung, Jiwan, et al.
Pubblicazione: (2024)
di: Chung, Jiwan, et al.
Pubblicazione: (2024)
Visual Representations inside the Language Model
di: Liu, Benlin, et al.
Pubblicazione: (2025)
di: Liu, Benlin, et al.
Pubblicazione: (2025)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
Adaptive Vision-Language Model Routing for Computer Use Agents
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
di: Chen, Junzhe, et al.
Pubblicazione: (2024)
di: Chen, Junzhe, et al.
Pubblicazione: (2024)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
Seeking and Updating with Live Visual Knowledge
di: Fu, Mingyang, et al.
Pubblicazione: (2025)
di: Fu, Mingyang, et al.
Pubblicazione: (2025)
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
di: Meng, Rui, et al.
Pubblicazione: (2025)
di: Meng, Rui, et al.
Pubblicazione: (2025)
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
di: Jin, Yang, et al.
Pubblicazione: (2024)
di: Jin, Yang, et al.
Pubblicazione: (2024)
VisuCraft: Enhancing Large Vision-Language Models for Complex Visual-Guided Creative Content Generation via Structured Information Extraction
di: Jiang, Rongxin, et al.
Pubblicazione: (2025)
di: Jiang, Rongxin, et al.
Pubblicazione: (2025)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
di: Liu, Zikang, et al.
Pubblicazione: (2025)
di: Liu, Zikang, et al.
Pubblicazione: (2025)
UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation
di: Ghosh, Shiv, et al.
Pubblicazione: (2026)
di: Ghosh, Shiv, et al.
Pubblicazione: (2026)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
di: Du, Yifan, et al.
Pubblicazione: (2023)
di: Du, Yifan, et al.
Pubblicazione: (2023)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
di: Dong, Shuai, et al.
Pubblicazione: (2025)
di: Dong, Shuai, et al.
Pubblicazione: (2025)
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
di: Dong, Qihua, et al.
Pubblicazione: (2026)
di: Dong, Qihua, et al.
Pubblicazione: (2026)
Modeling Intensification for Sign Language Generation: A Computational Approach
di: İnan, Mert, et al.
Pubblicazione: (2022)
di: İnan, Mert, et al.
Pubblicazione: (2022)
GEM: Context-Aware Gaze EstiMation with Visual Search Behavior Matching for Chest Radiograph
di: Liu, Shaonan, et al.
Pubblicazione: (2024)
di: Liu, Shaonan, et al.
Pubblicazione: (2024)
Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
di: Wang, Yubo, et al.
Pubblicazione: (2026)
di: Wang, Yubo, et al.
Pubblicazione: (2026)
InterCLIP-MEP: Interactive CLIP and Memory-Enhanced Predictor for Multi-modal Sarcasm Detection
di: Chen, Junjie, et al.
Pubblicazione: (2024)
di: Chen, Junjie, et al.
Pubblicazione: (2024)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MetFuse: Figurative Fusion between Metonymy and Metaphor
di: Ghosh, Saptarshi, et al.
Pubblicazione: (2026) -
ConMeC: A Dataset for Metonymy Resolution with Common Nouns
di: Ghosh, Saptarshi, et al.
Pubblicazione: (2025) -
Towards Robust Evaluation of Visual Activity Recognition: Resolving Verb Ambiguity with Sense Clustering
di: Yao, Louie Hong, et al.
Pubblicazione: (2025) -
Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026) -
Evaluating the Impact of Verbal Multiword Expressions on Machine Translation
di: Liu, Linfeng, et al.
Pubblicazione: (2025)