Guardado en:
| Autores principales: | Xu, Huilin, Chen, Tao, Xu, Feng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2403.10079 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Weakly Supervised Concept Learning for Object-centric Visual Reasoning
por: Tiwari, Sparsh, et al.
Publicado: (2026)
por: Tiwari, Sparsh, et al.
Publicado: (2026)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
por: Xu, Huilin, et al.
Publicado: (2025)
por: Xu, Huilin, et al.
Publicado: (2025)
RELO: Reinforcement Learning to Localize for Visual Object Tracking
por: Chen, Xin, et al.
Publicado: (2026)
por: Chen, Xin, et al.
Publicado: (2026)
Learning Disentangled Representation in Object-Centric Models for Visual Dynamics Prediction via Transformers
por: Gandhi, Sanket, et al.
Publicado: (2024)
por: Gandhi, Sanket, et al.
Publicado: (2024)
Object-centric Binding in Contrastive Language-Image Pretraining
por: Assouel, Rim, et al.
Publicado: (2025)
por: Assouel, Rim, et al.
Publicado: (2025)
SlotPi: Physics-informed Object-centric Reasoning Models
por: Li, Jian, et al.
Publicado: (2025)
por: Li, Jian, et al.
Publicado: (2025)
Serial Over Parallel: Learning Continual Unification for Multi-Modal Visual Object Tracking and Benchmarking
por: Tang, Zhangyong, et al.
Publicado: (2025)
por: Tang, Zhangyong, et al.
Publicado: (2025)
Object Isolated Attention for Consistent Story Visualization
por: Luo, Xiangyang, et al.
Publicado: (2025)
por: Luo, Xiangyang, et al.
Publicado: (2025)
Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection
por: Li, Wenqiao, et al.
Publicado: (2025)
por: Li, Wenqiao, et al.
Publicado: (2025)
Successes and Limitations of Object-centric Models at Compositional Generalisation
por: Montero, Milton L., et al.
Publicado: (2024)
por: Montero, Milton L., et al.
Publicado: (2024)
SlotLifter: Slot-guided Feature Lifting for Learning Object-centric Radiance Fields
por: Liu, Yu, et al.
Publicado: (2024)
por: Liu, Yu, et al.
Publicado: (2024)
Dynamic Attention Mechanism in Spatiotemporal Memory Networks for Object Tracking
por: Zhou, Meng, et al.
Publicado: (2025)
por: Zhou, Meng, et al.
Publicado: (2025)
DORSal: Diffusion for Object-centric Representations of Scenes et al
por: Jabri, Allan, et al.
Publicado: (2023)
por: Jabri, Allan, et al.
Publicado: (2023)
EfficientVMamba: Atrous Selective Scan for Light Weight Visual Mamba
por: Pei, Xiaohuan, et al.
Publicado: (2024)
por: Pei, Xiaohuan, et al.
Publicado: (2024)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
por: Zhu, Younan, et al.
Publicado: (2025)
por: Zhu, Younan, et al.
Publicado: (2025)
Towards End-to-End Neuromorphic Event-based 3D Object Reconstruction Without Physical Priors
por: Xu, Chuanzhi, et al.
Publicado: (2025)
por: Xu, Chuanzhi, et al.
Publicado: (2025)
CFMD: Dynamic Cross-layer Feature Fusion for Salient Object Detection
por: Lian, Jin, et al.
Publicado: (2025)
por: Lian, Jin, et al.
Publicado: (2025)
Adversarial Error Correction for Visual Autoregressive Generation
por: Bi, Ligong, et al.
Publicado: (2026)
por: Bi, Ligong, et al.
Publicado: (2026)
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
por: Nayak, Shravan, et al.
Publicado: (2025)
por: Nayak, Shravan, et al.
Publicado: (2025)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
por: Zhang, Jieyu, et al.
Publicado: (2024)
por: Zhang, Jieyu, et al.
Publicado: (2024)
MITracker: Multi-View Integration for Visual Object Tracking
por: Xu, Mengjie, et al.
Publicado: (2025)
por: Xu, Mengjie, et al.
Publicado: (2025)
Visual Grounding for Object-Level Generalization in Reinforcement Learning
por: Jiang, Haobin, et al.
Publicado: (2024)
por: Jiang, Haobin, et al.
Publicado: (2024)
OCK: Unsupervised Dynamic Video Prediction with Object-Centric Kinematics
por: Song, Yeon-Ji, et al.
Publicado: (2024)
por: Song, Yeon-Ji, et al.
Publicado: (2024)
Edge-case Synthesis for Fisheye Object Detection: A Data-centric Perspective
por: Kim, Seunghyeon, et al.
Publicado: (2025)
por: Kim, Seunghyeon, et al.
Publicado: (2025)
LocalMamba: Visual State Space Model with Windowed Selective Scan
por: Huang, Tao, et al.
Publicado: (2024)
por: Huang, Tao, et al.
Publicado: (2024)
Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning
por: Tu, Yunbin, et al.
Publicado: (2024)
por: Tu, Yunbin, et al.
Publicado: (2024)
EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision
por: Chen, Jiahao, et al.
Publicado: (2026)
por: Chen, Jiahao, et al.
Publicado: (2026)
IRNet: Iterative Refinement Network for Noisy Partial Label Learning
por: Lian, Zheng, et al.
Publicado: (2022)
por: Lian, Zheng, et al.
Publicado: (2022)
iPad: Iterative Proposal-centric End-to-End Autonomous Driving
por: Guo, Ke, et al.
Publicado: (2025)
por: Guo, Ke, et al.
Publicado: (2025)
Learning Dynamic Collaborative Network for Semi-supervised 3D Vessel Segmentation
por: Xu, Jiao, et al.
Publicado: (2026)
por: Xu, Jiao, et al.
Publicado: (2026)
Adaptive Runge-Kutta Dynamics for Spatiotemporal Prediction
por: Zhao, Xuanle, et al.
Publicado: (2024)
por: Zhao, Xuanle, et al.
Publicado: (2024)
InterDreamer: Zero-Shot Text to 3D Dynamic Human-Object Interaction
por: Xu, Sirui, et al.
Publicado: (2024)
por: Xu, Sirui, et al.
Publicado: (2024)
CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving
por: Chen, Shuhang, et al.
Publicado: (2026)
por: Chen, Shuhang, et al.
Publicado: (2026)
SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models
por: Zantout, Nader, et al.
Publicado: (2025)
por: Zantout, Nader, et al.
Publicado: (2025)
Cross-View Referring Multi-Object Tracking
por: Chen, Sijia, et al.
Publicado: (2024)
por: Chen, Sijia, et al.
Publicado: (2024)
A Novel Multi-layer Task-centric and Data Quality Framework for Autonomous Driving
por: Zhou, Yuhan, et al.
Publicado: (2025)
por: Zhou, Yuhan, et al.
Publicado: (2025)
High-fidelity Person-centric Subject-to-Image Synthesis
por: Wang, Yibin, et al.
Publicado: (2023)
por: Wang, Yibin, et al.
Publicado: (2023)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
por: Liu, Xu, et al.
Publicado: (2026)
por: Liu, Xu, et al.
Publicado: (2026)
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
por: Jiang, Yankai, et al.
Publicado: (2026)
por: Jiang, Yankai, et al.
Publicado: (2026)
MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis
por: Zhu, Chunzheng, et al.
Publicado: (2025)
por: Zhu, Chunzheng, et al.
Publicado: (2025)
Ejemplares similares
-
Weakly Supervised Concept Learning for Object-centric Visual Reasoning
por: Tiwari, Sparsh, et al.
Publicado: (2026) -
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
por: Xu, Huilin, et al.
Publicado: (2025) -
RELO: Reinforcement Learning to Localize for Visual Object Tracking
por: Chen, Xin, et al.
Publicado: (2026) -
Learning Disentangled Representation in Object-Centric Models for Visual Dynamics Prediction via Transformers
por: Gandhi, Sanket, et al.
Publicado: (2024) -
Object-centric Binding in Contrastive Language-Image Pretraining
por: Assouel, Rim, et al.
Publicado: (2025)