Salvato in:
| Autori principali: | Suissa, Omri, Ali, Muhiim, Azarbal, Ariana, Shen, Hui, Pradhan, Shekhar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2503.13021 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Contrastive Learning with Enhanced Abstract Representations using Grouped Loss of Abstract Semantic Supervision
di: Suissa, Omri, et al.
Pubblicazione: (2025)
di: Suissa, Omri, et al.
Pubblicazione: (2025)
Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time
di: Berger, Uri, et al.
Pubblicazione: (2025)
di: Berger, Uri, et al.
Pubblicazione: (2025)
Beyond Image-Text Matching: Verb Understanding in Multimodal Transformers Using Guided Masking
di: Beňová, Ivana, et al.
Pubblicazione: (2024)
di: Beňová, Ivana, et al.
Pubblicazione: (2024)
Generalised Medical Phrase Grounding
di: Zhang, Wenjun, et al.
Pubblicazione: (2025)
di: Zhang, Wenjun, et al.
Pubblicazione: (2025)
Surveying the Landscape of Image Captioning Evaluation: A Comprehensive Taxonomy, Trends and Metrics Analysis
di: Berger, Uri, et al.
Pubblicazione: (2024)
di: Berger, Uri, et al.
Pubblicazione: (2024)
Towards Robust Evaluation of Visual Activity Recognition: Resolving Verb Ambiguity with Sense Clustering
di: Yao, Louie Hong, et al.
Pubblicazione: (2025)
di: Yao, Louie Hong, et al.
Pubblicazione: (2025)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
di: Tang, Zihan, et al.
Pubblicazione: (2026)
di: Tang, Zihan, et al.
Pubblicazione: (2026)
Token Sequence Compression for Efficient Multimodal Computing
di: Omri, Yasmine, et al.
Pubblicazione: (2025)
di: Omri, Yasmine, et al.
Pubblicazione: (2025)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
FlairGPT: Repurposing LLMs for Interior Designs
di: Littlefair, Gabrielle, et al.
Pubblicazione: (2025)
di: Littlefair, Gabrielle, et al.
Pubblicazione: (2025)
GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting
di: Omri, Yasmine, et al.
Pubblicazione: (2025)
di: Omri, Yasmine, et al.
Pubblicazione: (2025)
$\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs
di: Fan, Yingqi, et al.
Pubblicazione: (2025)
di: Fan, Yingqi, et al.
Pubblicazione: (2025)
Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching
di: Chen, Wenjing
Pubblicazione: (2024)
di: Chen, Wenjing
Pubblicazione: (2024)
Unveiling the Invisible: Captioning Videos with Metaphors
di: Kalarani, Abisek Rajakumar, et al.
Pubblicazione: (2024)
di: Kalarani, Abisek Rajakumar, et al.
Pubblicazione: (2024)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language Models
di: Wang, Zehao, et al.
Pubblicazione: (2024)
di: Wang, Zehao, et al.
Pubblicazione: (2024)
Few-shot Adaptation to Distribution Shifts By Mixing Source and Target Embeddings
di: Xue, Yihao, et al.
Pubblicazione: (2023)
di: Xue, Yihao, et al.
Pubblicazione: (2023)
RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance
di: Venkatesh, Kavana, et al.
Pubblicazione: (2024)
di: Venkatesh, Kavana, et al.
Pubblicazione: (2024)
MIEB: Massive Image Embedding Benchmark
di: Xiao, Chenghao, et al.
Pubblicazione: (2025)
di: Xiao, Chenghao, et al.
Pubblicazione: (2025)
Lost in Embeddings: Information Loss in Vision-Language Models
di: Li, Wenyan, et al.
Pubblicazione: (2025)
di: Li, Wenyan, et al.
Pubblicazione: (2025)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
brat: Aligned Multi-View Embeddings for Brain MRI Analysis
di: Kayser, Maxime, et al.
Pubblicazione: (2025)
di: Kayser, Maxime, et al.
Pubblicazione: (2025)
Acceleration Multiple Heads Decoding for LLM via Dynamic Tree Attention
di: Zhang, Zhendong
Pubblicazione: (2025)
di: Zhang, Zhendong
Pubblicazione: (2025)
Inference Compute-Optimal Video Vision Language Models
di: Wang, Peiqi, et al.
Pubblicazione: (2025)
di: Wang, Peiqi, et al.
Pubblicazione: (2025)
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise
di: Shin, Philip Wootaek, et al.
Pubblicazione: (2026)
di: Shin, Philip Wootaek, et al.
Pubblicazione: (2026)
MatFormer: Nested Transformer for Elastic Inference
di: Devvrit, et al.
Pubblicazione: (2023)
di: Devvrit, et al.
Pubblicazione: (2023)
Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection
di: Wang, Shan, et al.
Pubblicazione: (2025)
di: Wang, Shan, et al.
Pubblicazione: (2025)
FrEVL: Leveraging Frozen Pretrained Embeddings for Efficient Vision-Language Understanding
di: Bourigault, Emmanuelle, et al.
Pubblicazione: (2025)
di: Bourigault, Emmanuelle, et al.
Pubblicazione: (2025)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
DoubleCCA: Improving Foundation Model Group Robustness with Random Sentence Embeddings
di: Liu, Hong, et al.
Pubblicazione: (2024)
di: Liu, Hong, et al.
Pubblicazione: (2024)
Natural Language Inference Improves Compositionality in Vision-Language Models
di: Cascante-Bonilla, Paola, et al.
Pubblicazione: (2024)
di: Cascante-Bonilla, Paola, et al.
Pubblicazione: (2024)
Inference-Time Structural Reasoning for Compositional Vision-Language Understanding
di: Bhattacharya, Amartya
Pubblicazione: (2026)
di: Bhattacharya, Amartya
Pubblicazione: (2026)
Expressive and Generalizable Low-rank Adaptation for Large Models via Slow Cascaded Learning
di: Li, Siwei, et al.
Pubblicazione: (2024)
di: Li, Siwei, et al.
Pubblicazione: (2024)
REBEL: Reinforcement Learning via Regressing Relative Rewards
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
di: Meng, Rui, et al.
Pubblicazione: (2025)
di: Meng, Rui, et al.
Pubblicazione: (2025)
TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems
di: Vo, Khang H. N., et al.
Pubblicazione: (2025)
di: Vo, Khang H. N., et al.
Pubblicazione: (2025)
Improving Arabic Multi-Label Emotion Classification using Stacked Embeddings and Hybrid Loss Function
di: Aslam, Muhammad Azeem, et al.
Pubblicazione: (2024)
di: Aslam, Muhammad Azeem, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Contrastive Learning with Enhanced Abstract Representations using Grouped Loss of Abstract Semantic Supervision
di: Suissa, Omri, et al.
Pubblicazione: (2025) -
Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time
di: Berger, Uri, et al.
Pubblicazione: (2025) -
Beyond Image-Text Matching: Verb Understanding in Multimodal Transformers Using Guided Masking
di: Beňová, Ivana, et al.
Pubblicazione: (2024) -
Generalised Medical Phrase Grounding
di: Zhang, Wenjun, et al.
Pubblicazione: (2025) -
Surveying the Landscape of Image Captioning Evaluation: A Comprehensive Taxonomy, Trends and Metrics Analysis
di: Berger, Uri, et al.
Pubblicazione: (2024)