Perceptual Flow Network for Visually Grounded Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yangfu, Gong, Yuning, Zhan, Hongjian, Li, Teng, Lyu, Yuanhuiyi, Chen, Tianyi, Liu, Qi, Huang, Ziyuan, Zhong, Zhihang, Zheng, Dandan, Lu, Yue |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025)
par: Raoufi, Behnam, et autres
Publié: (2025)
Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention
par: Durrani, Hamza Ahmed, et autres
Publié: (2026)
par: Durrani, Hamza Ahmed, et autres
Publié: (2026)
VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions
par: Pu, Qingwen, et autres
Publié: (2026)
par: Pu, Qingwen, et autres
Publié: (2026)
Decoupling Vision and Language: Codebook Anchored Visual Adaptation
par: Wu, Jason, et autres
Publié: (2026)
par: Wu, Jason, et autres
Publié: (2026)
OnlyFlow: Optical Flow based Motion Conditioning for Video Diffusion Models
par: Koroglu, Mathis, et autres
Publié: (2024)
par: Koroglu, Mathis, et autres
Publié: (2024)
Selection, Not Fusion: Radar-Modulated State Space Models for Radar-Camera Depth Estimation
par: Hou, Zhangcheng, et autres
Publié: (2026)
par: Hou, Zhangcheng, et autres
Publié: (2026)
Smooth regularization for efficient video recognition
par: Goldman, Gil, et autres
Publié: (2025)
par: Goldman, Gil, et autres
Publié: (2025)
Neuromorphic Monocular Depth Estimation with Uncertainty Modeling
par: Bergkvist, Viktor, et autres
Publié: (2026)
par: Bergkvist, Viktor, et autres
Publié: (2026)
WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents
par: Liu, Bingnan, et autres
Publié: (2026)
par: Liu, Bingnan, et autres
Publié: (2026)
FeedbackSTS-Det: Sparse Frames-Based Spatio-Temporal Semantic Feedback Network for Moving Infrared Small Target Detection
par: Huang, Yian, et autres
Publié: (2026)
par: Huang, Yian, et autres
Publié: (2026)
SERA-H: Beyond Native Sentinel Spatial Limits for High-Resolution Canopy Height Mapping
par: Boudras, Thomas, et autres
Publié: (2025)
par: Boudras, Thomas, et autres
Publié: (2025)
MaSC: A Masked Similarity Metric for Evaluating Concept-Driven Generation
par: Bartkowiak, Patryk, et autres
Publié: (2026)
par: Bartkowiak, Patryk, et autres
Publié: (2026)
Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
par: Yang, Shan
Publié: (2026)
par: Yang, Shan
Publié: (2026)
Optimal Transport-Guided Source-Free Adaptation for Face Anti-Spoofing
par: Li, Zhuowei, et autres
Publié: (2025)
par: Li, Zhuowei, et autres
Publié: (2025)
EduFlow: Advancing MLLMs' Problem-Solving Proficiency through Multi-Stage, Multi-Perspective Critique
par: Zhu, Chenglin, et autres
Publié: (2025)
par: Zhu, Chenglin, et autres
Publié: (2025)
Caption-Driven Explainability: Probing CNNs for Bias via CLIP
par: Koller, Patrick, et autres
Publié: (2025)
par: Koller, Patrick, et autres
Publié: (2025)
Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features
par: Chahine, Makram, et autres
Publié: (2024)
par: Chahine, Makram, et autres
Publié: (2024)
Butter: Frequency Consistency and Hierarchical Fusion for Autonomous Driving Object Detection
par: Lin, Xiaojian, et autres
Publié: (2025)
par: Lin, Xiaojian, et autres
Publié: (2025)
Object detection in adverse weather conditions for autonomous vehicles using Instruct Pix2Pix
par: Gurbindo, Unai, et autres
Publié: (2025)
par: Gurbindo, Unai, et autres
Publié: (2025)
Implementing Adaptations for Vision AutoRegressive Model
par: Shaikh, Kaif, et autres
Publié: (2025)
par: Shaikh, Kaif, et autres
Publié: (2025)
Cortex 2.0: Grounding World Models in Real-World Industrial Deployment
par: Aida, Adriana, et autres
Publié: (2026)
par: Aida, Adriana, et autres
Publié: (2026)
Efficient Attention: Attention with Linear Complexities
par: Shen, Zhuoran, et autres
Publié: (2018)
par: Shen, Zhuoran, et autres
Publié: (2018)
Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images
par: Chen, Yuangong, et autres
Publié: (2026)
par: Chen, Yuangong, et autres
Publié: (2026)
Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning
par: Ji, Binbin, et autres
Publié: (2025)
par: Ji, Binbin, et autres
Publié: (2025)
Spiking Neural Networks for event-based action recognition: A new task to understand their advantage
par: Vicente-Sola, Alex, et autres
Publié: (2022)
par: Vicente-Sola, Alex, et autres
Publié: (2022)
AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making
par: Li, Wenbo, et autres
Publié: (2025)
par: Li, Wenbo, et autres
Publié: (2025)
An Analysis of Layer-Freezing Strategies for Enhanced Transfer Learning in YOLO Architectures
par: Dobrzycki, Andrzej D., et autres
Publié: (2025)
par: Dobrzycki, Andrzej D., et autres
Publié: (2025)
Lightweight Prompt-Guided CLIP Adaptation for Monocular Depth Estimation
par: Manghotay, Reyhaneh Ahani, et autres
Publié: (2026)
par: Manghotay, Reyhaneh Ahani, et autres
Publié: (2026)
In Context Learning with Vision Transformers: Case Study
par: Zhao, Antony, et autres
Publié: (2025)
par: Zhao, Antony, et autres
Publié: (2025)
Dream to Fly: Model-Based Reinforcement Learning for Vision-Based Drone Flight
par: Romero, Angel, et autres
Publié: (2025)
par: Romero, Angel, et autres
Publié: (2025)
WayFASTER: a Self-Supervised Traversability Prediction for Increased Navigation Awareness
par: Gasparino, Mateus Valverde, et autres
Publié: (2024)
par: Gasparino, Mateus Valverde, et autres
Publié: (2024)
SUN Team's Contribution to ABAW 2024 Competition: Audio-visual Valence-Arousal Estimation and Expression Recognition
par: Dresvyanskiy, Denis, et autres
Publié: (2024)
par: Dresvyanskiy, Denis, et autres
Publié: (2024)
SpectralCA: Bi-Directional Cross-Attention for Next-Generation UAV Hyperspectral Vision
par: Brovko, D. V.
Publié: (2025)
par: Brovko, D. V.
Publié: (2025)
GLoT: A Novel Gated-Logarithmic Transformer for Efficient Sign Language Translation
par: Shahin, Nada, et autres
Publié: (2025)
par: Shahin, Nada, et autres
Publié: (2025)
Learning 3D object-centric representation through prediction
par: Day, John, et autres
Publié: (2024)
par: Day, John, et autres
Publié: (2024)
OmniAcc: Personalized Accessibility Assistant Using Generative AI
par: Karki, Siddhant, et autres
Publié: (2025)
par: Karki, Siddhant, et autres
Publié: (2025)
Leum-VL Technical Report
par: He, Yuxuan, et autres
Publié: (2026)
par: He, Yuxuan, et autres
Publié: (2026)
Predictive Modeling of Maritime Radar Data Using Transformer Architecture
par: Qesaraku, Bjorna, et autres
Publié: (2025)
par: Qesaraku, Bjorna, et autres
Publié: (2025)
MSPCaps: A Multi-Scale Patchify Capsule Network with Cross-Agreement Routing for Visual Recognition
par: Hu, Yudong, et autres
Publié: (2025)
par: Hu, Yudong, et autres
Publié: (2025)
Salient Concept-Aware Generative Data Augmentation
par: Zhao, Tianchen, et autres
Publié: (2025)
par: Zhao, Tianchen, et autres
Publié: (2025)
Documents similaires
-
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025) -
Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention
par: Durrani, Hamza Ahmed, et autres
Publié: (2026) -
VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions
par: Pu, Qingwen, et autres
Publié: (2026) -
Decoupling Vision and Language: Codebook Anchored Visual Adaptation
par: Wu, Jason, et autres
Publié: (2026) -
OnlyFlow: Optical Flow based Motion Conditioning for Video Diffusion Models
par: Koroglu, Mathis, et autres
Publié: (2024)