TextlessRAG: End-to-End Visual Document RAG by Speech Without Text
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Peijin, Qian, Shun, Liu, Bingquan, Wang, Dexin, Sun, Lin, Zhang, Xiangzheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Expand VSR Benchmark for VLLM to Expertize in Spatial Rules
par: Xie, Peijin, et autres
Publié: (2024)
par: Xie, Peijin, et autres
Publié: (2024)
End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
par: Zheng, Qiaoyu, et autres
Publié: (2025)
par: Zheng, Qiaoyu, et autres
Publié: (2025)
RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding
par: Li, Yinglu, et autres
Publié: (2025)
par: Li, Yinglu, et autres
Publié: (2025)
Efficient End-to-End Visual Document Understanding with Rationale Distillation
par: Zhu, Wang, et autres
Publié: (2023)
par: Zhu, Wang, et autres
Publié: (2023)
DLAFormer: An End-to-End Transformer For Document Layout Analysis
par: Wang, Jiawei, et autres
Publié: (2024)
par: Wang, Jiawei, et autres
Publié: (2024)
Spatial-Aware Efficient Projector for MLLMs via Multi-Layer Feature Aggregation
par: Qian, Shun, et autres
Publié: (2024)
par: Qian, Shun, et autres
Publié: (2024)
Knowledge-based learning in Text-RAG and Image-RAG
par: Shim, Alexander, et autres
Publié: (2026)
par: Shim, Alexander, et autres
Publié: (2026)
Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs
par: Cheng, Dabing, et autres
Publié: (2025)
par: Cheng, Dabing, et autres
Publié: (2025)
RAG-Adapter: A Plug-and-Play RAG-enhanced Framework for Long Video Understanding
par: Tan, Xichen, et autres
Publié: (2025)
par: Tan, Xichen, et autres
Publié: (2025)
ObjectVLA: End-to-End Open-World Object Manipulation Without Demonstration
par: Zhu, Minjie, et autres
Publié: (2025)
par: Zhu, Minjie, et autres
Publié: (2025)
Bridging the Gap Between End-to-End and Two-Step Text Spotting
par: Huang, Mingxin, et autres
Publié: (2024)
par: Huang, Mingxin, et autres
Publié: (2024)
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
par: Cao, Linhan, et autres
Publié: (2026)
par: Cao, Linhan, et autres
Publié: (2026)
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
par: Dong, Daxiang, et autres
Publié: (2026)
par: Dong, Daxiang, et autres
Publié: (2026)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
par: Wu, Yin, et autres
Publié: (2025)
par: Wu, Yin, et autres
Publié: (2025)
SDformer: Efficient End-to-End Transformer for Depth Completion
par: Qian, Jian, et autres
Publié: (2024)
par: Qian, Jian, et autres
Publié: (2024)
CREPE: Coordinate-Aware End-to-End Document Parser
par: Okamoto, Yamato, et autres
Publié: (2024)
par: Okamoto, Yamato, et autres
Publié: (2024)
Fully Unified Motion Planning for End-to-End Autonomous Driving
par: Liu, Lin, et autres
Publié: (2025)
par: Liu, Lin, et autres
Publié: (2025)
End-to-End Vision Tokenizer Tuning
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering
par: Li, Bingxin
Publié: (2025)
par: Li, Bingxin
Publié: (2025)
TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision
par: Zhai, Yukun, et autres
Publié: (2023)
par: Zhai, Yukun, et autres
Publié: (2023)
End-to-End Visual Autonomous Parking via Control-Aided Attention
par: Chen, Chao, et autres
Publié: (2025)
par: Chen, Chao, et autres
Publié: (2025)
Polar R-CNN: End-to-End Lane Detection with Fewer Anchors
par: Wang, Shengqi, et autres
Publié: (2024)
par: Wang, Shengqi, et autres
Publié: (2024)
SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
par: Sun, Wenchao, et autres
Publié: (2024)
par: Sun, Wenchao, et autres
Publié: (2024)
RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution
par: Jian, Siyong, et autres
Publié: (2026)
par: Jian, Siyong, et autres
Publié: (2026)
CoProU-VO: Combining Projected Uncertainty for End-to-End Unsupervised Monocular Visual Odometry
par: Xie, Jingchao, et autres
Publié: (2025)
par: Xie, Jingchao, et autres
Publié: (2025)
An End-to-End Robust Point Cloud Semantic Segmentation Network with Single-Step Conditional Diffusion Models
par: Qu, Wentao, et autres
Publié: (2024)
par: Qu, Wentao, et autres
Publié: (2024)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
par: Xue, Junxiao, et autres
Publié: (2024)
par: Xue, Junxiao, et autres
Publié: (2024)
YOLOv10: Real-Time End-to-End Object Detection
par: Wang, Ao, et autres
Publié: (2024)
par: Wang, Ao, et autres
Publié: (2024)
End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning
par: Zhang, Jinrong, et autres
Publié: (2023)
par: Zhang, Jinrong, et autres
Publié: (2023)
Mesh RAG: Retrieval Augmentation for Autoregressive Mesh Generation
par: Sun, Xiatao, et autres
Publié: (2025)
par: Sun, Xiatao, et autres
Publié: (2025)
End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames
par: Liu, Shuming, et autres
Publié: (2023)
par: Liu, Shuming, et autres
Publié: (2023)
VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
par: Jiang, Bo, et autres
Publié: (2024)
par: Jiang, Bo, et autres
Publié: (2024)
VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph
par: Wang, Qiuchen, et autres
Publié: (2026)
par: Wang, Qiuchen, et autres
Publié: (2026)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
par: Zhu, Jiaying, et autres
Publié: (2025)
par: Zhu, Jiaying, et autres
Publié: (2025)
SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
par: Chen, Jian, et autres
Publié: (2024)
par: Chen, Jian, et autres
Publié: (2024)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
par: Jiang, Bo, et autres
Publié: (2024)
par: Jiang, Bo, et autres
Publié: (2024)
Visual Product Graph: Bridging Visual Products And Composite Images For End-to-End Style Recommendations
par: Du, Yue Li, et autres
Publié: (2025)
par: Du, Yue Li, et autres
Publié: (2025)
MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction
par: Liao, Bencheng, et autres
Publié: (2023)
par: Liao, Bencheng, et autres
Publié: (2023)
PAVE: An End-to-End Dataset for Production Autonomous Vehicle Evaluation
par: Li, Xiangyu, et autres
Publié: (2025)
par: Li, Xiangyu, et autres
Publié: (2025)
OPERA: An Agent for Image Restoration with End-to-End Joint Planning-Execution Optimization
par: Zhu, Feng, et autres
Publié: (2026)
par: Zhu, Feng, et autres
Publié: (2026)
Documents similaires
-
Expand VSR Benchmark for VLLM to Expertize in Spatial Rules
par: Xie, Peijin, et autres
Publié: (2024) -
End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
par: Zheng, Qiaoyu, et autres
Publié: (2025) -
RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding
par: Li, Yinglu, et autres
Publié: (2025) -
Efficient End-to-End Visual Document Understanding with Rationale Distillation
par: Zhu, Wang, et autres
Publié: (2023) -
DLAFormer: An End-to-End Transformer For Document Layout Analysis
par: Wang, Jiawei, et autres
Publié: (2024)