DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness
Fuente:
arXiv
Salvato in:
| Autori principali: | Mohammadshirazi, Ahmad, Neogi, Pinaki Prasad Guha, Lim, Ser-Nam, Ramnath, Rajiv |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2025)
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2025)
MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2025)
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2025)
InsightBuild: LLM-Powered Causal Reasoning in Smart Building Systems
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025)
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025)
PIAD-SRNN: Physics-Informed Adaptive Decomposition in State-Space RNN
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
ALCo-FM: Adaptive Long-Context Foundation Model for Accident Prediction
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025)
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025)
Exploiting the Experts: Unauthorized Compression in MoE-LLMs
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025)
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025)
DocParseNet: Advanced Semantic Segmentation and OCR Embeddings for Efficient Scanned Document Annotation
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
Frequency-Guided Masking for Enhanced Vision Self-Supervised Learning
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
di: Meyarian, Abolfazl, et al.
Pubblicazione: (2026)
di: Meyarian, Abolfazl, et al.
Pubblicazione: (2026)
DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
di: Park, Dongmin, et al.
Pubblicazione: (2024)
di: Park, Dongmin, et al.
Pubblicazione: (2024)
Towards Chunk-Wise Generation for Long Videos
di: Zhang, Siyang, et al.
Pubblicazione: (2024)
di: Zhang, Siyang, et al.
Pubblicazione: (2024)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
VideoMerge: Towards Training-free Long Video Generation
di: Zhang, Siyang, et al.
Pubblicazione: (2025)
di: Zhang, Siyang, et al.
Pubblicazione: (2025)
Controlla: Learning Controllability via Graph-Constrained Latent Geometry
di: Murthy, Jamuna S., et al.
Pubblicazione: (2026)
di: Murthy, Jamuna S., et al.
Pubblicazione: (2026)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
di: Inal, Gokce, et al.
Pubblicazione: (2026)
di: Inal, Gokce, et al.
Pubblicazione: (2026)
Vision-Language Integration for Zero-Shot Scene Understanding in Real-World Environments
di: Rajiv, Manjunath Prasad Holenarasipura, et al.
Pubblicazione: (2025)
di: Rajiv, Manjunath Prasad Holenarasipura, et al.
Pubblicazione: (2025)
Yo'LLaVA: Your Personalized Language and Vision Assistant
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
Video Decomposition Prior: A Methodology to Decompose Videos into Layers
di: Shrivastava, Gaurav, et al.
Pubblicazione: (2024)
di: Shrivastava, Gaurav, et al.
Pubblicazione: (2024)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
di: Lu, Weiheng, et al.
Pubblicazione: (2024)
di: Lu, Weiheng, et al.
Pubblicazione: (2024)
Dynamic Context-Aware Scene Reasoning Using Vision-Language Alignment in Zero-Shot Real-World Scenarios
di: Rajiv, Manjunath Prasad Holenarasipura, et al.
Pubblicazione: (2025)
di: Rajiv, Manjunath Prasad Holenarasipura, et al.
Pubblicazione: (2025)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
DreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data
di: Tu, Yuanpeng, et al.
Pubblicazione: (2025)
di: Tu, Yuanpeng, et al.
Pubblicazione: (2025)
Towards Unified 3D Object Detection via Algorithm and Data Unification
di: Li, Zhuoling, et al.
Pubblicazione: (2024)
di: Li, Zhuoling, et al.
Pubblicazione: (2024)
Composing Object Relations and Attributes for Image-Text Matching
di: Pham, Khoi, et al.
Pubblicazione: (2024)
di: Pham, Khoi, et al.
Pubblicazione: (2024)
Fast Encoding and Decoding for Implicit Video Representation
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop
di: Qian, Zhaofang, et al.
Pubblicazione: (2024)
di: Qian, Zhaofang, et al.
Pubblicazione: (2024)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
di: Chen, Harold Haodong, et al.
Pubblicazione: (2024)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2024)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
TriFusion-AE: Language-Guided Depth and LiDAR Fusion for Robust Point Cloud Processing
di: Neogi, Susmit
Pubblicazione: (2025)
di: Neogi, Susmit
Pubblicazione: (2025)
Power-LLaVA: Large Language and Vision Assistant for Power Transmission Line Inspection
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
Language-free Compositional Action Generation via Decoupling Refinement
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
FSViewFusion: Few-Shots View Generation of Novel Objects
di: Hussain, Rukhshanda, et al.
Pubblicazione: (2024)
di: Hussain, Rukhshanda, et al.
Pubblicazione: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
di: Sun, Guohao, et al.
Pubblicazione: (2024)
di: Sun, Guohao, et al.
Pubblicazione: (2024)
LARM: Large Auto-Regressive Model for Long-Horizon Embodied Intelligence
di: Li, Zhuoling, et al.
Pubblicazione: (2024)
di: Li, Zhuoling, et al.
Pubblicazione: (2024)
BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration
di: Gao, Bo, et al.
Pubblicazione: (2026)
di: Gao, Bo, et al.
Pubblicazione: (2026)
STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering
di: Sun, Guohao, et al.
Pubblicazione: (2024)
di: Sun, Guohao, et al.
Pubblicazione: (2024)
AirSketch: Generative Motion to Sketch
di: Lim, Hui Xian Grace, et al.
Pubblicazione: (2024)
di: Lim, Hui Xian Grace, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2025) -
MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2025) -
InsightBuild: LLM-Powered Causal Reasoning in Smart Building Systems
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025) -
PIAD-SRNN: Physics-Informed Adaptive Decomposition in State-Space RNN
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024) -
ALCo-FM: Adaptive Long-Context Foundation Model for Accident Prediction
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025)