An Enhanced Large Language Model For Cross Modal Query Understanding System Using DL-KeyBERT Based CAZSSCL-MPGPT
Fuente:
arXiv
Salvato in:
| Autore principale: | Singh, Shreya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improved Alignment of Modalities in Large Vision Language Models
di: Jangra, Kartik, et al.
Pubblicazione: (2025)
di: Jangra, Kartik, et al.
Pubblicazione: (2025)
X-VILA: Cross-Modality Alignment for Large Language Model
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
Quantifying Cross-Modality Memorization in Vision-Language Models
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
Enhancing Cross-Modal Fine-Tuning with Gradually Intermediate Modality Generation
di: Cai, Lincan, et al.
Pubblicazione: (2024)
di: Cai, Lincan, et al.
Pubblicazione: (2024)
Beyond Uniform Query Distribution: Key-Driven Grouped Query Attention
di: Khan, Zohaib, et al.
Pubblicazione: (2024)
di: Khan, Zohaib, et al.
Pubblicazione: (2024)
Improve Academic Query Resolution through BERT-based Question Extraction from Images
di: Kamal, Nidhi, et al.
Pubblicazione: (2024)
di: Kamal, Nidhi, et al.
Pubblicazione: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
DL-QAT: Weight-Decomposed Low-Rank Quantization-Aware Training for Large Language Models
di: Ke, Wenjin, et al.
Pubblicazione: (2025)
di: Ke, Wenjin, et al.
Pubblicazione: (2025)
Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings
di: Dhimoïla, Grégoire, et al.
Pubblicazione: (2026)
di: Dhimoïla, Grégoire, et al.
Pubblicazione: (2026)
Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
Cross-Modal Adapter: Parameter-Efficient Transfer Learning Approach for Vision-Language Models
di: Yang, Juncheng, et al.
Pubblicazione: (2024)
di: Yang, Juncheng, et al.
Pubblicazione: (2024)
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)
di: Luo, Grace, et al.
Pubblicazione: (2024)
MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video Understanding
di: Li, Pengyi, et al.
Pubblicazione: (2025)
di: Li, Pengyi, et al.
Pubblicazione: (2025)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories
di: Naharas, Nilay, et al.
Pubblicazione: (2025)
di: Naharas, Nilay, et al.
Pubblicazione: (2025)
OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models
di: Ray, Lala Shakti Swarup, et al.
Pubblicazione: (2024)
di: Ray, Lala Shakti Swarup, et al.
Pubblicazione: (2024)
Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models
di: Groot, Tobias, et al.
Pubblicazione: (2024)
di: Groot, Tobias, et al.
Pubblicazione: (2024)
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
di: Wang, Sudong, et al.
Pubblicazione: (2025)
di: Wang, Sudong, et al.
Pubblicazione: (2025)
ConDL: Detector-Free Dense Image Matching
di: Kwiatkowski, Monika, et al.
Pubblicazione: (2024)
di: Kwiatkowski, Monika, et al.
Pubblicazione: (2024)
Gems: Group Emotion Profiling Through Multimodal Situational Understanding
di: Kataria, Anubhav, et al.
Pubblicazione: (2025)
di: Kataria, Anubhav, et al.
Pubblicazione: (2025)
Temporal Visual Semantics-Induced Human Motion Understanding with Large Language Models
di: Xing, Zheng, et al.
Pubblicazione: (2025)
di: Xing, Zheng, et al.
Pubblicazione: (2025)
U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding
di: Le, Anjie, et al.
Pubblicazione: (2025)
di: Le, Anjie, et al.
Pubblicazione: (2025)
Conformal Cross-Modal Active Learning
di: Nguyen, Huy Hoang, et al.
Pubblicazione: (2026)
di: Nguyen, Huy Hoang, et al.
Pubblicazione: (2026)
Open-Vocabulary Panoptic Segmentation Using BERT Pre-Training of Vision-Language Multiway Transformer Model
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Mind the Gap: Learning Modality-Agnostic Representations with a Cross-Modality UNet
di: Niu, Xin, et al.
Pubblicazione: (2026)
di: Niu, Xin, et al.
Pubblicazione: (2026)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
di: Cai, Rui, et al.
Pubblicazione: (2025)
di: Cai, Rui, et al.
Pubblicazione: (2025)
Single-Channel Tissue Segmentation via Cross-Modal Distillation from Foundation Models
di: Mohammad, Sakib, et al.
Pubblicazione: (2026)
di: Mohammad, Sakib, et al.
Pubblicazione: (2026)
Large Model for Small Data: Foundation Model for Cross-Modal RF Human Activity Recognition
di: Weng, Yuxuan, et al.
Pubblicazione: (2024)
di: Weng, Yuxuan, et al.
Pubblicazione: (2024)
DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities
di: Lu, Jueqing, et al.
Pubblicazione: (2025)
di: Lu, Jueqing, et al.
Pubblicazione: (2025)
GCM-Net: Graph-enhanced Cross-Modal Infusion with a Metaheuristic-Driven Network for Video Sentiment and Emotion Analysis
di: Chaudhari, Prasad, et al.
Pubblicazione: (2024)
di: Chaudhari, Prasad, et al.
Pubblicazione: (2024)
PROMISE: Prompt-Attentive Hierarchical Contrastive Learning for Robust Cross-Modal Representation with Missing Modalities
di: Chen, Jiajun, et al.
Pubblicazione: (2025)
di: Chen, Jiajun, et al.
Pubblicazione: (2025)
Hyperbolic Concept Bottleneck Models
di: Uyterlinde, Daniel, et al.
Pubblicazione: (2026)
di: Uyterlinde, Daniel, et al.
Pubblicazione: (2026)
Do-Undo Bench: Reversibility for Action Understanding in Image Generation
di: Mahajan, Shweta, et al.
Pubblicazione: (2025)
di: Mahajan, Shweta, et al.
Pubblicazione: (2025)
MMRL: Multi-Modal Representation Learning for Vision-Language Models
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
Information Router for Mitigating Modality Dominance in Vision-Language Models
di: Kim, Seulgi, et al.
Pubblicazione: (2026)
di: Kim, Seulgi, et al.
Pubblicazione: (2026)
Bridge the Modality and Capability Gaps in Vision-Language Model Selection
di: Yi, Chao, et al.
Pubblicazione: (2024)
di: Yi, Chao, et al.
Pubblicazione: (2024)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improved Alignment of Modalities in Large Vision Language Models
di: Jangra, Kartik, et al.
Pubblicazione: (2025) -
X-VILA: Cross-Modality Alignment for Large Language Model
di: Ye, Hanrong, et al.
Pubblicazione: (2024) -
Quantifying Cross-Modality Memorization in Vision-Language Models
di: Wen, Yuxin, et al.
Pubblicazione: (2025) -
Enhancing Cross-Modal Fine-Tuning with Gradually Intermediate Modality Generation
di: Cai, Lincan, et al.
Pubblicazione: (2024) -
Beyond Uniform Query Distribution: Key-Driven Grouped Query Attention
di: Khan, Zohaib, et al.
Pubblicazione: (2024)