From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors via LLM-guided Symbolic Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Zeng, Yuhui, Wu, Haoxiang, Nie, Wenjie, Zheng, Xiawu, Chen, Guangyao, Shen, Yunhang, Peng, Jun, Tian, Yonghong, Ji, Rongrong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
by: Luo, Liqin, et al.
Published: (2025)
by: Luo, Liqin, et al.
Published: (2025)
Event-Anchored Frame Selection for Effective Long-Video Understanding
by: Chen, Wang, et al.
Published: (2026)
by: Chen, Wang, et al.
Published: (2026)
HUWSOD: Holistic Self-training for Unified Weakly Supervised Object Detection
by: Cao, Liujuan, et al.
Published: (2024)
by: Cao, Liujuan, et al.
Published: (2024)
EmambaIR: Efficient Visual State Space Model for Event-guided Image Reconstruction
by: Yu, Wei, et al.
Published: (2026)
by: Yu, Wei, et al.
Published: (2026)
Benchmarking Abstract and Reasoning Abilities Through A Theoretical Perspective
by: Ma, Qingchuan, et al.
Published: (2025)
by: Ma, Qingchuan, et al.
Published: (2025)
Adversarial Attack for RGB-Event based Visual Object Tracking
by: Chen, Qiang, et al.
Published: (2025)
by: Chen, Qiang, et al.
Published: (2025)
Solving the Catastrophic Forgetting Problem in Generalized Category Discovery
by: Cao, Xinzi, et al.
Published: (2025)
by: Cao, Xinzi, et al.
Published: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
by: Zhou, Chenyu, et al.
Published: (2024)
by: Zhou, Chenyu, et al.
Published: (2024)
Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
by: Li, Xudong, et al.
Published: (2024)
by: Li, Xudong, et al.
Published: (2024)
Uncovering the Over-smoothing Challenge in Image Super-Resolution: Entropy-based Quantification and Contrastive Optimization
by: Xu, Tianshuo, et al.
Published: (2022)
by: Xu, Tianshuo, et al.
Published: (2022)
ALGOGEN: Tool-Generated Verifiable Traces for Reliable Algorithm Visualization
by: Liao, Kunpeng, et al.
Published: (2026)
by: Liao, Kunpeng, et al.
Published: (2026)
Object Detection using Event Camera: A MoE Heat Conduction based Detector and A New Benchmark Dataset
by: Wang, Xiao, et al.
Published: (2024)
by: Wang, Xiao, et al.
Published: (2024)
Efficient Event Stream Super-Resolution with Recursive Multi-Branch Fusion
by: Liang, Quanmin, et al.
Published: (2024)
by: Liang, Quanmin, et al.
Published: (2024)
Dynamic Pondering Sparsity-aware Mixture-of-Experts Transformer for Event Stream based Visual Object Tracking
by: Wang, Shiao, et al.
Published: (2026)
by: Wang, Shiao, et al.
Published: (2026)
Event Stream-based Visual Object Tracking: HDETrack V2 and A High-Definition Benchmark
by: Wang, Shiao, et al.
Published: (2025)
by: Wang, Shiao, et al.
Published: (2025)
Towards Low-Latency Event Stream-based Visual Object Tracking: A Slow-Fast Approach
by: Wang, Shiao, et al.
Published: (2025)
by: Wang, Shiao, et al.
Published: (2025)
Decoupling Amplitude and Phase Attention in Frequency Domain for RGB-Event based Visual Object Tracking
by: Wang, Shiao, et al.
Published: (2026)
by: Wang, Shiao, et al.
Published: (2026)
Parsing Objects at a Finer Granularity: A Survey
by: Zhao, Yifan, et al.
Published: (2022)
by: Zhao, Yifan, et al.
Published: (2022)
A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation
by: Ma, Qingchuan, et al.
Published: (2026)
by: Ma, Qingchuan, et al.
Published: (2026)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
by: Qian, Zhipeng, et al.
Published: (2024)
by: Qian, Zhipeng, et al.
Published: (2024)
An Information Theory-inspired Strategy for Automatic Network Pruning
by: Zheng, Xiawu, et al.
Published: (2021)
by: Zheng, Xiawu, et al.
Published: (2021)
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
by: Chen, Wang, et al.
Published: (2026)
by: Chen, Wang, et al.
Published: (2026)
SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
by: Xie, Tianyu, et al.
Published: (2026)
by: Xie, Tianyu, et al.
Published: (2026)
HDI-Former: Hybrid Dynamic Interaction ANN-SNN Transformer for Object Detection Using Frames and Events
by: Li, Dianze, et al.
Published: (2024)
by: Li, Dianze, et al.
Published: (2024)
CRSOT: Cross-Resolution Object Tracking using Unaligned Frame and Event Cameras
by: Zhu, Yabin, et al.
Published: (2024)
by: Zhu, Yabin, et al.
Published: (2024)
Hyper-YOLO: When Visual Object Detection Meets Hypergraph Computation
by: Feng, Yifan, et al.
Published: (2024)
by: Feng, Yifan, et al.
Published: (2024)
Structured Spatial Reasoning with Open Vocabulary Object Detectors
by: Nejatishahidin, Negar, et al.
Published: (2024)
by: Nejatishahidin, Negar, et al.
Published: (2024)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
by: Tong, Bo, et al.
Published: (2024)
by: Tong, Bo, et al.
Published: (2024)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
by: Gao, Timin, et al.
Published: (2024)
by: Gao, Timin, et al.
Published: (2024)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
by: Li, Xudong, et al.
Published: (2025)
by: Li, Xudong, et al.
Published: (2025)
ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning
by: Lv, Guannan, et al.
Published: (2026)
by: Lv, Guannan, et al.
Published: (2026)
ObjectAdd: Adding Objects into Image via a Training-Free Diffusion Modification Fashion
by: Zhang, Ziyue, et al.
Published: (2024)
by: Zhang, Ziyue, et al.
Published: (2024)
Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning
by: Cheng, Hanbo, et al.
Published: (2026)
by: Cheng, Hanbo, et al.
Published: (2026)
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
by: Wang, Yaoting, et al.
Published: (2024)
by: Wang, Yaoting, et al.
Published: (2024)
Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?
by: Li, Jia, et al.
Published: (2025)
by: Li, Jia, et al.
Published: (2025)
GeoRemover: Removing Objects and Their Causal Visual Artifacts
by: Zhu, Zixin, et al.
Published: (2025)
by: Zhu, Zixin, et al.
Published: (2025)
Feature Denoising Diffusion Model for Blind Image Quality Assessment
by: Li, Xudong, et al.
Published: (2024)
by: Li, Xudong, et al.
Published: (2024)
Dynamic Graph Induced Contour-aware Heat Conduction Network for Event-based Object Detection
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
Towards Efficient Automatic Self-Pruning of Large Language Models
by: Huang, Weizhong, et al.
Published: (2025)
by: Huang, Weizhong, et al.
Published: (2025)
Determining Layer-wise Sparsity for Large Language Models Through a Theoretical Perspective
by: Huang, Weizhong, et al.
Published: (2025)
by: Huang, Weizhong, et al.
Published: (2025)
Similar Items
-
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
by: Luo, Liqin, et al.
Published: (2025) -
Event-Anchored Frame Selection for Effective Long-Video Understanding
by: Chen, Wang, et al.
Published: (2026) -
HUWSOD: Holistic Self-training for Unified Weakly Supervised Object Detection
by: Cao, Liujuan, et al.
Published: (2024) -
EmambaIR: Efficient Visual State Space Model for Event-guided Image Reconstruction
by: Yu, Wei, et al.
Published: (2026) -
Benchmarking Abstract and Reasoning Abilities Through A Theoretical Perspective
by: Ma, Qingchuan, et al.
Published: (2025)