Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Songyuan, Yu, Weijiang, Liu, Ziyu, Tang, Guijian, Yang, Wenjing, Tan, Huibin, Xiao, Nong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning
por: Yang, Songyuan, et al.
Publicado: (2026)
por: Yang, Songyuan, et al.
Publicado: (2026)
AnyUser: Translating Sketched User Intent into Domestic Robots
por: Yang, Songyuan, et al.
Publicado: (2026)
por: Yang, Songyuan, et al.
Publicado: (2026)
FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion
por: Lu, Yu, et al.
Publicado: (2025)
por: Lu, Yu, et al.
Publicado: (2025)
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
por: Han, Su Ho, et al.
Publicado: (2025)
por: Han, Su Ho, et al.
Publicado: (2025)
FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis
por: Tan, Jiangtong, et al.
Publicado: (2025)
por: Tan, Jiangtong, et al.
Publicado: (2025)
KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing
por: Cai, Mingshu, et al.
Publicado: (2026)
por: Cai, Mingshu, et al.
Publicado: (2026)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
por: Liu, Zhuchenyang, et al.
Publicado: (2026)
por: Liu, Zhuchenyang, et al.
Publicado: (2026)
Exploring Low-Resource Medical Image Classification with Weakly Supervised Prompt Learning
por: Zheng, Fudan, et al.
Publicado: (2024)
por: Zheng, Fudan, et al.
Publicado: (2024)
Object-Aware Video Matting with Cross-Frame Guidance
por: Zhang, Huayu, et al.
Publicado: (2025)
por: Zhang, Huayu, et al.
Publicado: (2025)
Video Finetuning Improves Reasoning Between Frames
por: Yang, Ruiqi, et al.
Publicado: (2025)
por: Yang, Ruiqi, et al.
Publicado: (2025)
Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
por: Jang, Sangwon, et al.
Publicado: (2025)
por: Jang, Sangwon, et al.
Publicado: (2025)
BeyondFacial: Identity-Preserving Personalized Generation Beyond Facial Close-ups
por: Zhang, Songsong, et al.
Publicado: (2025)
por: Zhang, Songsong, et al.
Publicado: (2025)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
por: Wang, Zehan, et al.
Publicado: (2024)
por: Wang, Zehan, et al.
Publicado: (2024)
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
por: Feng, X., et al.
Publicado: (2026)
por: Feng, X., et al.
Publicado: (2026)
Not All Frame Features Are Equal: Video-to-4D Generation via Decoupling Dynamic-Static Features
por: Yang, Liying, et al.
Publicado: (2025)
por: Yang, Liying, et al.
Publicado: (2025)
Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning
por: Yang, Shuonan, et al.
Publicado: (2026)
por: Yang, Shuonan, et al.
Publicado: (2026)
DiffuseSlide: Training-Free High Frame Rate Video Generation Diffusion
por: Hwang, Geunmin, et al.
Publicado: (2025)
por: Hwang, Geunmin, et al.
Publicado: (2025)
FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity
por: Tang, Jian, et al.
Publicado: (2026)
por: Tang, Jian, et al.
Publicado: (2026)
HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
por: Yang, Yiqing, et al.
Publicado: (2025)
por: Yang, Yiqing, et al.
Publicado: (2025)
FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
por: Lu, Yu, et al.
Publicado: (2024)
por: Lu, Yu, et al.
Publicado: (2024)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
por: Han, Kai, et al.
Publicado: (2024)
por: Han, Kai, et al.
Publicado: (2024)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
por: Zhang, Yongchang, et al.
Publicado: (2026)
por: Zhang, Yongchang, et al.
Publicado: (2026)
Intensive Vision-guided Network for Radiology Report Generation
por: Zheng, Fudan, et al.
Publicado: (2024)
por: Zheng, Fudan, et al.
Publicado: (2024)
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
por: Sun, Xiaokun, et al.
Publicado: (2026)
por: Sun, Xiaokun, et al.
Publicado: (2026)
Detection-Fusion for Knowledge Graph Extraction from Videos
por: Das, Taniya, et al.
Publicado: (2024)
por: Das, Taniya, et al.
Publicado: (2024)
Auditing Training-Free 3D Shape Retrieval with Diffused Geodesic Moments
por: Du, Zhicheng, et al.
Publicado: (2026)
por: Du, Zhicheng, et al.
Publicado: (2026)
EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory
por: Xiao, Ruiqiang, et al.
Publicado: (2026)
por: Xiao, Ruiqiang, et al.
Publicado: (2026)
Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training
por: Gong, Biao, et al.
Publicado: (2023)
por: Gong, Biao, et al.
Publicado: (2023)
Beyond Boundary Frames: Context-Centric Video Interpolation with Audio-Visual Semantics
por: Deng, Yuchen, et al.
Publicado: (2025)
por: Deng, Yuchen, et al.
Publicado: (2025)
ZeroSmooth: Training-free Diffuser Adaptation for High Frame Rate Video Generation
por: Yang, Shaoshu, et al.
Publicado: (2024)
por: Yang, Shaoshu, et al.
Publicado: (2024)
Tracking Any Point with Frame-Event Fusion Network at High Frame Rate
por: Liu, Jiaxiong, et al.
Publicado: (2024)
por: Liu, Jiaxiong, et al.
Publicado: (2024)
An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval
por: Kandhare, Mahesh, et al.
Publicado: (2024)
por: Kandhare, Mahesh, et al.
Publicado: (2024)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
por: Ge, Haonan, et al.
Publicado: (2025)
por: Ge, Haonan, et al.
Publicado: (2025)
Reasoning-Aware Multimodal Fusion for Hateful Video Detection
por: Yang, Shuonan, et al.
Publicado: (2025)
por: Yang, Shuonan, et al.
Publicado: (2025)
Progress-Aware Video Frame Captioning
por: Xue, Zihui, et al.
Publicado: (2024)
por: Xue, Zihui, et al.
Publicado: (2024)
Language-to-Space Programming for Training-Free 3D Visual Grounding
por: Mi, Boyu, et al.
Publicado: (2025)
por: Mi, Boyu, et al.
Publicado: (2025)
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
por: Qiu, Haiyi, et al.
Publicado: (2024)
por: Qiu, Haiyi, et al.
Publicado: (2024)
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
por: Luo, Liqin, et al.
Publicado: (2025)
por: Luo, Liqin, et al.
Publicado: (2025)
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
por: Chen, Zhuokun, et al.
Publicado: (2024)
por: Chen, Zhuokun, et al.
Publicado: (2024)
Ejemplares similares
-
Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning
por: Yang, Songyuan, et al.
Publicado: (2026) -
AnyUser: Translating Sketched User Intent into Domestic Robots
por: Yang, Songyuan, et al.
Publicado: (2026) -
FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion
por: Lu, Yu, et al.
Publicado: (2025) -
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
por: Han, Su Ho, et al.
Publicado: (2025) -
FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis
por: Tan, Jiangtong, et al.
Publicado: (2025)