DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mohammadshirazi, Ahmad, Neogi, Pinaki Prasad Guha, Lim, Ser-Nam, Ramnath, Rajiv |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
par: Mohammadshirazi, Ahmad, et autres
Publié: (2025)
par: Mohammadshirazi, Ahmad, et autres
Publié: (2025)
MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use
par: Mohammadshirazi, Ahmad, et autres
Publié: (2025)
par: Mohammadshirazi, Ahmad, et autres
Publié: (2025)
InsightBuild: LLM-Powered Causal Reasoning in Smart Building Systems
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025)
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025)
PIAD-SRNN: Physics-Informed Adaptive Decomposition in State-Space RNN
par: Mohammadshirazi, Ahmad, et autres
Publié: (2024)
par: Mohammadshirazi, Ahmad, et autres
Publié: (2024)
ALCo-FM: Adaptive Long-Context Foundation Model for Accident Prediction
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025)
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025)
Exploiting the Experts: Unauthorized Compression in MoE-LLMs
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025)
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025)
DocParseNet: Advanced Semantic Segmentation and OCR Embeddings for Efficient Scanned Document Annotation
par: Mohammadshirazi, Ahmad, et autres
Publié: (2024)
par: Mohammadshirazi, Ahmad, et autres
Publié: (2024)
Frequency-Guided Masking for Enhanced Vision Self-Supervised Learning
par: Monsefi, Amin Karimi, et autres
Publié: (2024)
par: Monsefi, Amin Karimi, et autres
Publié: (2024)
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
par: Meyarian, Abolfazl, et autres
Publié: (2026)
par: Meyarian, Abolfazl, et autres
Publié: (2026)
DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks
par: Monsefi, Amin Karimi, et autres
Publié: (2024)
par: Monsefi, Amin Karimi, et autres
Publié: (2024)
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
par: Park, Dongmin, et autres
Publié: (2024)
par: Park, Dongmin, et autres
Publié: (2024)
Towards Chunk-Wise Generation for Long Videos
par: Zhang, Siyang, et autres
Publié: (2024)
par: Zhang, Siyang, et autres
Publié: (2024)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
VideoMerge: Towards Training-free Long Video Generation
par: Zhang, Siyang, et autres
Publié: (2025)
par: Zhang, Siyang, et autres
Publié: (2025)
Controlla: Learning Controllability via Graph-Constrained Latent Geometry
par: Murthy, Jamuna S., et autres
Publié: (2026)
par: Murthy, Jamuna S., et autres
Publié: (2026)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
par: Inal, Gokce, et autres
Publié: (2026)
par: Inal, Gokce, et autres
Publié: (2026)
Vision-Language Integration for Zero-Shot Scene Understanding in Real-World Environments
par: Rajiv, Manjunath Prasad Holenarasipura, et autres
Publié: (2025)
par: Rajiv, Manjunath Prasad Holenarasipura, et autres
Publié: (2025)
Yo'LLaVA: Your Personalized Language and Vision Assistant
par: Nguyen, Thao, et autres
Publié: (2024)
par: Nguyen, Thao, et autres
Publié: (2024)
Video Decomposition Prior: A Methodology to Decompose Videos into Layers
par: Shrivastava, Gaurav, et autres
Publié: (2024)
par: Shrivastava, Gaurav, et autres
Publié: (2024)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
par: Lu, Weiheng, et autres
Publié: (2024)
par: Lu, Weiheng, et autres
Publié: (2024)
Dynamic Context-Aware Scene Reasoning Using Vision-Language Alignment in Zero-Shot Real-World Scenarios
par: Rajiv, Manjunath Prasad Holenarasipura, et autres
Publié: (2025)
par: Rajiv, Manjunath Prasad Holenarasipura, et autres
Publié: (2025)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024)
par: Guo, Xuechen, et autres
Publié: (2024)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
par: Imran, Muhammad, et autres
Publié: (2025)
par: Imran, Muhammad, et autres
Publié: (2025)
DreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data
par: Tu, Yuanpeng, et autres
Publié: (2025)
par: Tu, Yuanpeng, et autres
Publié: (2025)
Towards Unified 3D Object Detection via Algorithm and Data Unification
par: Li, Zhuoling, et autres
Publié: (2024)
par: Li, Zhuoling, et autres
Publié: (2024)
Composing Object Relations and Attributes for Image-Text Matching
par: Pham, Khoi, et autres
Publié: (2024)
par: Pham, Khoi, et autres
Publié: (2024)
Fast Encoding and Decoding for Implicit Video Representation
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop
par: Qian, Zhaofang, et autres
Publié: (2024)
par: Qian, Zhaofang, et autres
Publié: (2024)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
par: Chen, Harold Haodong, et autres
Publié: (2024)
par: Chen, Harold Haodong, et autres
Publié: (2024)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
TriFusion-AE: Language-Guided Depth and LiDAR Fusion for Robust Point Cloud Processing
par: Neogi, Susmit
Publié: (2025)
par: Neogi, Susmit
Publié: (2025)
Power-LLaVA: Large Language and Vision Assistant for Power Transmission Line Inspection
par: Wang, Jiahao, et autres
Publié: (2024)
par: Wang, Jiahao, et autres
Publié: (2024)
Language-free Compositional Action Generation via Decoupling Refinement
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
FSViewFusion: Few-Shots View Generation of Novel Objects
par: Hussain, Rukhshanda, et autres
Publié: (2024)
par: Hussain, Rukhshanda, et autres
Publié: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
LARM: Large Auto-Regressive Model for Long-Horizon Embodied Intelligence
par: Li, Zhuoling, et autres
Publié: (2024)
par: Li, Zhuoling, et autres
Publié: (2024)
BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration
par: Gao, Bo, et autres
Publié: (2026)
par: Gao, Bo, et autres
Publié: (2026)
STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
AirSketch: Generative Motion to Sketch
par: Lim, Hui Xian Grace, et autres
Publié: (2024)
par: Lim, Hui Xian Grace, et autres
Publié: (2024)
Documents similaires
-
ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
par: Mohammadshirazi, Ahmad, et autres
Publié: (2025) -
MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use
par: Mohammadshirazi, Ahmad, et autres
Publié: (2025) -
InsightBuild: LLM-Powered Causal Reasoning in Smart Building Systems
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025) -
PIAD-SRNN: Physics-Informed Adaptive Decomposition in State-Space RNN
par: Mohammadshirazi, Ahmad, et autres
Publié: (2024) -
ALCo-FM: Adaptive Long-Context Foundation Model for Accident Prediction
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025)