Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Songyuan, Yu, Weijiang, Liu, Ziyu, Tang, Guijian, Yang, Wenjing, Tan, Huibin, Xiao, Nong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning
di: Yang, Songyuan, et al.
Pubblicazione: (2026)
di: Yang, Songyuan, et al.
Pubblicazione: (2026)
AnyUser: Translating Sketched User Intent into Domestic Robots
di: Yang, Songyuan, et al.
Pubblicazione: (2026)
di: Yang, Songyuan, et al.
Pubblicazione: (2026)
FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion
di: Lu, Yu, et al.
Pubblicazione: (2025)
di: Lu, Yu, et al.
Pubblicazione: (2025)
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
di: Han, Su Ho, et al.
Pubblicazione: (2025)
di: Han, Su Ho, et al.
Pubblicazione: (2025)
FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis
di: Tan, Jiangtong, et al.
Pubblicazione: (2025)
di: Tan, Jiangtong, et al.
Pubblicazione: (2025)
KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing
di: Cai, Mingshu, et al.
Pubblicazione: (2026)
di: Cai, Mingshu, et al.
Pubblicazione: (2026)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
Exploring Low-Resource Medical Image Classification with Weakly Supervised Prompt Learning
di: Zheng, Fudan, et al.
Pubblicazione: (2024)
di: Zheng, Fudan, et al.
Pubblicazione: (2024)
Object-Aware Video Matting with Cross-Frame Guidance
di: Zhang, Huayu, et al.
Pubblicazione: (2025)
di: Zhang, Huayu, et al.
Pubblicazione: (2025)
Video Finetuning Improves Reasoning Between Frames
di: Yang, Ruiqi, et al.
Pubblicazione: (2025)
di: Yang, Ruiqi, et al.
Pubblicazione: (2025)
Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
di: Jang, Sangwon, et al.
Pubblicazione: (2025)
di: Jang, Sangwon, et al.
Pubblicazione: (2025)
BeyondFacial: Identity-Preserving Personalized Generation Beyond Facial Close-ups
di: Zhang, Songsong, et al.
Pubblicazione: (2025)
di: Zhang, Songsong, et al.
Pubblicazione: (2025)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
di: Wang, Zehan, et al.
Pubblicazione: (2024)
di: Wang, Zehan, et al.
Pubblicazione: (2024)
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
di: Feng, X., et al.
Pubblicazione: (2026)
di: Feng, X., et al.
Pubblicazione: (2026)
Not All Frame Features Are Equal: Video-to-4D Generation via Decoupling Dynamic-Static Features
di: Yang, Liying, et al.
Pubblicazione: (2025)
di: Yang, Liying, et al.
Pubblicazione: (2025)
Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning
di: Yang, Shuonan, et al.
Pubblicazione: (2026)
di: Yang, Shuonan, et al.
Pubblicazione: (2026)
DiffuseSlide: Training-Free High Frame Rate Video Generation Diffusion
di: Hwang, Geunmin, et al.
Pubblicazione: (2025)
di: Hwang, Geunmin, et al.
Pubblicazione: (2025)
FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity
di: Tang, Jian, et al.
Pubblicazione: (2026)
di: Tang, Jian, et al.
Pubblicazione: (2026)
HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
di: Lu, Yu, et al.
Pubblicazione: (2024)
di: Lu, Yu, et al.
Pubblicazione: (2024)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
di: Han, Kai, et al.
Pubblicazione: (2024)
di: Han, Kai, et al.
Pubblicazione: (2024)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
Intensive Vision-guided Network for Radiology Report Generation
di: Zheng, Fudan, et al.
Pubblicazione: (2024)
di: Zheng, Fudan, et al.
Pubblicazione: (2024)
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
di: Sun, Xiaokun, et al.
Pubblicazione: (2026)
di: Sun, Xiaokun, et al.
Pubblicazione: (2026)
Detection-Fusion for Knowledge Graph Extraction from Videos
di: Das, Taniya, et al.
Pubblicazione: (2024)
di: Das, Taniya, et al.
Pubblicazione: (2024)
Auditing Training-Free 3D Shape Retrieval with Diffused Geodesic Moments
di: Du, Zhicheng, et al.
Pubblicazione: (2026)
di: Du, Zhicheng, et al.
Pubblicazione: (2026)
EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory
di: Xiao, Ruiqiang, et al.
Pubblicazione: (2026)
di: Xiao, Ruiqiang, et al.
Pubblicazione: (2026)
Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training
di: Gong, Biao, et al.
Pubblicazione: (2023)
di: Gong, Biao, et al.
Pubblicazione: (2023)
Beyond Boundary Frames: Context-Centric Video Interpolation with Audio-Visual Semantics
di: Deng, Yuchen, et al.
Pubblicazione: (2025)
di: Deng, Yuchen, et al.
Pubblicazione: (2025)
ZeroSmooth: Training-free Diffuser Adaptation for High Frame Rate Video Generation
di: Yang, Shaoshu, et al.
Pubblicazione: (2024)
di: Yang, Shaoshu, et al.
Pubblicazione: (2024)
Tracking Any Point with Frame-Event Fusion Network at High Frame Rate
di: Liu, Jiaxiong, et al.
Pubblicazione: (2024)
di: Liu, Jiaxiong, et al.
Pubblicazione: (2024)
An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval
di: Kandhare, Mahesh, et al.
Pubblicazione: (2024)
di: Kandhare, Mahesh, et al.
Pubblicazione: (2024)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
di: Ge, Haonan, et al.
Pubblicazione: (2025)
di: Ge, Haonan, et al.
Pubblicazione: (2025)
Reasoning-Aware Multimodal Fusion for Hateful Video Detection
di: Yang, Shuonan, et al.
Pubblicazione: (2025)
di: Yang, Shuonan, et al.
Pubblicazione: (2025)
Progress-Aware Video Frame Captioning
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
Language-to-Space Programming for Training-Free 3D Visual Grounding
di: Mi, Boyu, et al.
Pubblicazione: (2025)
di: Mi, Boyu, et al.
Pubblicazione: (2025)
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
di: Qiu, Haiyi, et al.
Pubblicazione: (2024)
di: Qiu, Haiyi, et al.
Pubblicazione: (2024)
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
di: Luo, Liqin, et al.
Pubblicazione: (2025)
di: Luo, Liqin, et al.
Pubblicazione: (2025)
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
di: Chen, Zhuokun, et al.
Pubblicazione: (2024)
di: Chen, Zhuokun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning
di: Yang, Songyuan, et al.
Pubblicazione: (2026) -
AnyUser: Translating Sketched User Intent into Domestic Robots
di: Yang, Songyuan, et al.
Pubblicazione: (2026) -
FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion
di: Lu, Yu, et al.
Pubblicazione: (2025) -
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
di: Han, Su Ho, et al.
Pubblicazione: (2025) -
FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis
di: Tan, Jiangtong, et al.
Pubblicazione: (2025)