CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Xiang, Fang, Wanlong, Wang, Changshuo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Rethinking Video-Language Model from the Language Input Perspective
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network
di: Fang, Xiang, et al.
Pubblicazione: (2024)
di: Fang, Xiang, et al.
Pubblicazione: (2024)
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
CogniMap3D: Cognitive 3D Mapping and Rapid Retrieval
di: Wang, Feiran, et al.
Pubblicazione: (2026)
di: Wang, Feiran, et al.
Pubblicazione: (2026)
Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
ModaVerse: Efficiently Transforming Modalities with LLMs
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization
di: Li, Jinghan, et al.
Pubblicazione: (2026)
di: Li, Jinghan, et al.
Pubblicazione: (2026)
Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Taylor Series-Inspired Local Structure Fitting Network for Few-shot Point Cloud Semantic Segmentation
di: Wang, Changshuo, et al.
Pubblicazione: (2025)
di: Wang, Changshuo, et al.
Pubblicazione: (2025)
Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model
di: Wen, Congcong, et al.
Pubblicazione: (2025)
di: Wen, Congcong, et al.
Pubblicazione: (2025)
MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World
di: Dhiman, Ankit, et al.
Pubblicazione: (2025)
di: Dhiman, Ankit, et al.
Pubblicazione: (2025)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2022)
di: Fang, Xiang, et al.
Pubblicazione: (2022)
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation
di: Jiang, Haichao, et al.
Pubblicazione: (2026)
di: Jiang, Haichao, et al.
Pubblicazione: (2026)
MMGR: Multi-Modal Generative Reasoning
di: Cai, Zefan, et al.
Pubblicazione: (2025)
di: Cai, Zefan, et al.
Pubblicazione: (2025)
Multi-Modal and Multi-Resolution Data Fusion for High-Resolution Cloud Removal: A Novel Baseline and Benchmark
di: Xu, Fang, et al.
Pubblicazione: (2023)
di: Xu, Fang, et al.
Pubblicazione: (2023)
Continual Cross-Modal Generalization
di: Xia, Yan, et al.
Pubblicazione: (2025)
di: Xia, Yan, et al.
Pubblicazione: (2025)
AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition
di: Wang, Zeheng, et al.
Pubblicazione: (2026)
di: Wang, Zeheng, et al.
Pubblicazione: (2026)
EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis
di: Tang, Yi, et al.
Pubblicazione: (2025)
di: Tang, Yi, et al.
Pubblicazione: (2025)
VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control
di: Zheng, Sixiao, et al.
Pubblicazione: (2026)
di: Zheng, Sixiao, et al.
Pubblicazione: (2026)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
di: Li, Yongqi, et al.
Pubblicazione: (2024)
di: Li, Yongqi, et al.
Pubblicazione: (2024)
DAug: Diffusion-based Channel Augmentation for Radiology Image Retrieval and Classification
di: Jin, Ying, et al.
Pubblicazione: (2024)
di: Jin, Ying, et al.
Pubblicazione: (2024)
CAR-MFL: Cross-Modal Augmentation by Retrieval for Multimodal Federated Learning with Missing Modalities
di: Poudel, Pranav, et al.
Pubblicazione: (2024)
di: Poudel, Pranav, et al.
Pubblicazione: (2024)
Open-World 3D Scene Graph Generation for Retrieval-Augmented Reasoning
di: Yu, Fei, et al.
Pubblicazione: (2025)
di: Yu, Fei, et al.
Pubblicazione: (2025)
Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2025)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2025)
CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
di: Li, Yan, et al.
Pubblicazione: (2025)
di: Li, Yan, et al.
Pubblicazione: (2025)
Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation
di: Wang, Junjie, et al.
Pubblicazione: (2026)
di: Wang, Junjie, et al.
Pubblicazione: (2026)
GeoVideo: Introducing Geometric Regularization into Video Generation Model
di: Bai, Yunpeng, et al.
Pubblicazione: (2025)
di: Bai, Yunpeng, et al.
Pubblicazione: (2025)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
di: Sun, Yubo, et al.
Pubblicazione: (2025)
di: Sun, Yubo, et al.
Pubblicazione: (2025)
MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
di: Chen, Kaixiang, et al.
Pubblicazione: (2026)
di: Chen, Kaixiang, et al.
Pubblicazione: (2026)
Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion Models
di: Fang, Hao, et al.
Pubblicazione: (2025)
di: Fang, Hao, et al.
Pubblicazione: (2025)
ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch
di: Liu, Zheng, et al.
Pubblicazione: (2026)
di: Liu, Zheng, et al.
Pubblicazione: (2026)
Retrieval Augmented Recipe Generation
di: Liu, Guoshan, et al.
Pubblicazione: (2024)
di: Liu, Guoshan, et al.
Pubblicazione: (2024)
Retrieval Augmented Comic Image Generation
di: Shui, Yunhao, et al.
Pubblicazione: (2025)
di: Shui, Yunhao, et al.
Pubblicazione: (2025)
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
di: Ju, Xuan, et al.
Pubblicazione: (2025)
di: Ju, Xuan, et al.
Pubblicazione: (2025)
Mamba-Based Modality Disentanglement Network for Multi-Contrast MRI Reconstruction
di: Lyu, Weiyi, et al.
Pubblicazione: (2025)
di: Lyu, Weiyi, et al.
Pubblicazione: (2025)
CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose
di: Jin, Li, et al.
Pubblicazione: (2026)
di: Jin, Li, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
di: Fang, Xiang, et al.
Pubblicazione: (2026) -
Rethinking Video-Language Model from the Language Input Perspective
di: Fang, Xiang, et al.
Pubblicazione: (2026) -
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026) -
Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network
di: Fang, Xiang, et al.
Pubblicazione: (2024) -
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
di: Fang, Xiang, et al.
Pubblicazione: (2026)