OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Chaoyi, Li, Baoqing, Di, Xinhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
di: Satish, Siddarth Nilol Kundur, et al.
Pubblicazione: (2026)
di: Satish, Siddarth Nilol Kundur, et al.
Pubblicazione: (2026)
Visible Iris Area as a Quality Metric for Reliable Iris Recognition Under Pupil Dilation and Eyelid Occlusion
di: Pessaud, Jack, et al.
Pubblicazione: (2025)
di: Pessaud, Jack, et al.
Pubblicazione: (2025)
Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention
di: Durrani, Hamza Ahmed, et al.
Pubblicazione: (2026)
di: Durrani, Hamza Ahmed, et al.
Pubblicazione: (2026)
NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models
di: Lee, Kyuho, et al.
Pubblicazione: (2025)
di: Lee, Kyuho, et al.
Pubblicazione: (2025)
CoMatcher: Multi-View Collaborative Feature Matching
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
Semi supervised GAN for smart microscopy, fast and data efficient cell cycle classification
di: Manick, Rajeev, et al.
Pubblicazione: (2026)
di: Manick, Rajeev, et al.
Pubblicazione: (2026)
Domain-Adaptive Pretraining Improves Primate Behavior Recognition
di: Mueller, Felix B., et al.
Pubblicazione: (2025)
di: Mueller, Felix B., et al.
Pubblicazione: (2025)
MSPCaps: A Multi-Scale Patchify Capsule Network with Cross-Agreement Routing for Visual Recognition
di: Hu, Yudong, et al.
Pubblicazione: (2025)
di: Hu, Yudong, et al.
Pubblicazione: (2025)
From eye to AI: studying rodent social behavior in the era of machine Learning
di: Chindemi, Giuseppe, et al.
Pubblicazione: (2025)
di: Chindemi, Giuseppe, et al.
Pubblicazione: (2025)
A Recipe for Geometry-Aware 3D Mesh Transformers
di: Farazi, Mohammad, et al.
Pubblicazione: (2024)
di: Farazi, Mohammad, et al.
Pubblicazione: (2024)
Towards a Generalizable Fusion Architecture for Multimodal Object Detection
di: Berjawi, Jad, et al.
Pubblicazione: (2025)
di: Berjawi, Jad, et al.
Pubblicazione: (2025)
A Vision-Language Model for Focal Liver Lesion Classification
di: Jian, Song, et al.
Pubblicazione: (2025)
di: Jian, Song, et al.
Pubblicazione: (2025)
MoDE: Mixture of Diffusion Experts for Any Occluded Face Recognition
di: Fan, Qiannan, et al.
Pubblicazione: (2025)
di: Fan, Qiannan, et al.
Pubblicazione: (2025)
Image-Based Leopard Seal Recognition: Approaches and Challenges in Current Automated Systems
di: Salazar, Jorge Yero, et al.
Pubblicazione: (2024)
di: Salazar, Jorge Yero, et al.
Pubblicazione: (2024)
Motion-Guided Semantic Alignment with Negative Prompts for Zero-Shot Video Action Recognition
di: Wang, Yiming, et al.
Pubblicazione: (2026)
di: Wang, Yiming, et al.
Pubblicazione: (2026)
TAG-Head: Time-Aligned Graph Head for Plug-and-Play Fine-grained Action Recognition
di: Hassan, Imtiaz Ul, et al.
Pubblicazione: (2026)
di: Hassan, Imtiaz Ul, et al.
Pubblicazione: (2026)
OmniAcc: Personalized Accessibility Assistant Using Generative AI
di: Karki, Siddhant, et al.
Pubblicazione: (2025)
di: Karki, Siddhant, et al.
Pubblicazione: (2025)
NeuroGaze-Distill: Brain-informed Distillation and Depression-Inspired Geometric Priors for Robust Facial Emotion Recognition
di: Li, Zilin, et al.
Pubblicazione: (2025)
di: Li, Zilin, et al.
Pubblicazione: (2025)
From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation
di: Chen, Jingkun, et al.
Pubblicazione: (2025)
di: Chen, Jingkun, et al.
Pubblicazione: (2025)
THIRDEYE: Cue-Aware Monocular Depth Estimation via Brain-Inspired Multi-Stage Fusion
di: Ioan, Calin Teodor
Pubblicazione: (2025)
di: Ioan, Calin Teodor
Pubblicazione: (2025)
VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models
di: Su, Yuetong, et al.
Pubblicazione: (2025)
di: Su, Yuetong, et al.
Pubblicazione: (2025)
Large Language Models and 3D Vision for Intelligent Robotic Perception and Autonomy
di: Mehta, Vinit, et al.
Pubblicazione: (2025)
di: Mehta, Vinit, et al.
Pubblicazione: (2025)
RSTeller: Scaling Up Visual Language Modeling in Remote Sensing with Rich Linguistic Semantics from Openly Available Data and Large Language Models
di: Ge, Junyao, et al.
Pubblicazione: (2024)
di: Ge, Junyao, et al.
Pubblicazione: (2024)
From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding
di: Gonzalez, Leonardo
Pubblicazione: (2026)
di: Gonzalez, Leonardo
Pubblicazione: (2026)
Joint Learning of Depth, Pose, and Local Radiance Field for Large Scale Monocular 3D Reconstruction
di: Syed, Shahram Najam, et al.
Pubblicazione: (2025)
di: Syed, Shahram Najam, et al.
Pubblicazione: (2025)
VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions
di: Pu, Qingwen, et al.
Pubblicazione: (2026)
di: Pu, Qingwen, et al.
Pubblicazione: (2026)
Prompt Sensitivity in Vision-Language Grounding: How Small Changes in Wording Affect Object Detection
di: Deka, Dawar Jyoti, et al.
Pubblicazione: (2026)
di: Deka, Dawar Jyoti, et al.
Pubblicazione: (2026)
SPMamba-YOLO: An Underwater Object Detection Network Based on Multi-Scale Feature Enhancement and Global Context Modeling
di: Liao, Guanghao, et al.
Pubblicazione: (2026)
di: Liao, Guanghao, et al.
Pubblicazione: (2026)
Context in object detection: a systematic literature review
di: Jamali, Mahtab, et al.
Pubblicazione: (2025)
di: Jamali, Mahtab, et al.
Pubblicazione: (2025)
Mask-Conditioned Voxel Diffusion for Joint Geometry and Color Inpainting
di: Sumuk, Aarya
Pubblicazione: (2026)
di: Sumuk, Aarya
Pubblicazione: (2026)
Pedestrian Detection in Low-Light Conditions: A Comprehensive Survey
di: Ghari, Bahareh, et al.
Pubblicazione: (2024)
di: Ghari, Bahareh, et al.
Pubblicazione: (2024)
FlowIBR: Leveraging Pre-Training for Efficient Neural Image-Based Rendering of Dynamic Scenes
di: Büsching, Marcel, et al.
Pubblicazione: (2023)
di: Büsching, Marcel, et al.
Pubblicazione: (2023)
IMASHRIMP: Automatic White Shrimp (Penaeus vannamei) Biometrical Analysis from Laboratory Images Using Computer Vision and Deep Learning
di: González, Abiam Remache, et al.
Pubblicazione: (2025)
di: González, Abiam Remache, et al.
Pubblicazione: (2025)
Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens
di: Shen, Meng, et al.
Pubblicazione: (2026)
di: Shen, Meng, et al.
Pubblicazione: (2026)
A Simple Baseline for Streaming Video Understanding
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
EmoVerse: A MLLMs-Driven Emotion Representation Dataset for Interpretable Visual Emotion Analysis
di: Guo, Yijie, et al.
Pubblicazione: (2025)
di: Guo, Yijie, et al.
Pubblicazione: (2025)
SimWorld: A Unified Benchmark for Simulator-Conditioned Scene Generation via World Model
di: Li, Xinqing, et al.
Pubblicazione: (2025)
di: Li, Xinqing, et al.
Pubblicazione: (2025)
SCA-Net: Spatial-Contextual Aggregation Network for Enhanced Small Building and Road Change Detection
di: Gholibeigi, Emad, et al.
Pubblicazione: (2026)
di: Gholibeigi, Emad, et al.
Pubblicazione: (2026)
Synthetic-Child: An AIGC-Based Synthetic Data Pipeline for Privacy-Preserving Child Posture Estimation
di: Zeng, Taowen
Pubblicazione: (2026)
di: Zeng, Taowen
Pubblicazione: (2026)
Documenti analoghi
-
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
di: Raoufi, Behnam, et al.
Pubblicazione: (2025) -
PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
di: Satish, Siddarth Nilol Kundur, et al.
Pubblicazione: (2026) -
Visible Iris Area as a Quality Metric for Reliable Iris Recognition Under Pupil Dilation and Eyelid Occlusion
di: Pessaud, Jack, et al.
Pubblicazione: (2025) -
Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention
di: Durrani, Hamza Ahmed, et al.
Pubblicazione: (2026) -
NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models
di: Lee, Kyuho, et al.
Pubblicazione: (2025)