Efficiently Disentangling CLIP for Multi-Object Perception
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rawlekar, Samyak, Cai, Yujun, Wang, Yiwei, Yang, Ming-Hsuan, Ahuja, Narendra |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Finding Distributed Object-Centric Properties in Self-Supervised Transformers
par: Rawlekar, Samyak, et autres
Publié: (2026)
par: Rawlekar, Samyak, et autres
Publié: (2026)
Learning Implicit Representation for Reconstructing Articulated Objects
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
S3O: A Dual-Phase Approach for Reconstructing Dynamic Shape and Skeleton of Articulated Objects from Single Monocular Video
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Rethinking Prompting Strategies for Multi-Label Recognition with Partial Annotations
par: Rawlekar, Samyak, et autres
Publié: (2024)
par: Rawlekar, Samyak, et autres
Publié: (2024)
Improving Multi-label Recognition using Class Co-Occurrence Probabilities
par: Rawlekar, Samyak, et autres
Publié: (2024)
par: Rawlekar, Samyak, et autres
Publié: (2024)
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
par: Ge, Haonan, et autres
Publié: (2025)
par: Ge, Haonan, et autres
Publié: (2025)
CSL: Class-Agnostic Structure-Constrained Learning for Segmentation Including the Unseen
par: Zhang, Hao, et autres
Publié: (2023)
par: Zhang, Hao, et autres
Publié: (2023)
PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs
par: Sun, Bowen, et autres
Publié: (2025)
par: Sun, Bowen, et autres
Publié: (2025)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
par: Wu, Hang, et autres
Publié: (2026)
par: Wu, Hang, et autres
Publié: (2026)
Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models
par: Wang, Zhaochen, et autres
Publié: (2025)
par: Wang, Zhaochen, et autres
Publié: (2025)
SegDebias: Test-Time Bias Mitigation for ViT-Based CLIP via Segmentation
par: Wu, Fangyu, et autres
Publié: (2025)
par: Wu, Fangyu, et autres
Publié: (2025)
PhysRig: Differentiable Physics-Based Skinning and Rigging Framework for Realistic Articulated Object Modeling
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
par: Li, Sifan, et autres
Publié: (2025)
par: Li, Sifan, et autres
Publié: (2025)
Weakly Supervised 3D Object Detection via Multi-Level Visual Guidance
par: Huang, Kuan-Chih, et autres
Publié: (2023)
par: Huang, Kuan-Chih, et autres
Publié: (2023)
Ranking-aware adapter for text-driven image ordering with CLIP
par: Yu, Wei-Hsiang, et autres
Publié: (2024)
par: Yu, Wei-Hsiang, et autres
Publié: (2024)
RGB-Only Supervised Camera Parameter Optimization in Dynamic Scenes
par: Li, Fang, et autres
Publié: (2025)
par: Li, Fang, et autres
Publié: (2025)
Self-Calibrating 4D Novel View Synthesis from Monocular Videos Using Gaussian Splatting
par: Li, Fang, et autres
Publié: (2024)
par: Li, Fang, et autres
Publié: (2024)
PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object Detection
par: Huang, Kuan-Chih, et autres
Publié: (2023)
par: Huang, Kuan-Chih, et autres
Publié: (2023)
Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models
par: Wang, Zhaochen, et autres
Publié: (2025)
par: Wang, Zhaochen, et autres
Publié: (2025)
ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
par: Wu, Yike, et autres
Publié: (2025)
par: Wu, Yike, et autres
Publié: (2025)
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
par: Tao, Xingjian, et autres
Publié: (2026)
par: Tao, Xingjian, et autres
Publié: (2026)
HENet++: Hybrid Encoding and Multi-task Learning for 3D Perception and End-to-end Autonomous Driving
par: Xia, Zhongyu, et autres
Publié: (2025)
par: Xia, Zhongyu, et autres
Publié: (2025)
Measuring the (Un)Faithfulness of Concept-Based Explanations
par: Kumar, Shubham, et autres
Publié: (2025)
par: Kumar, Shubham, et autres
Publié: (2025)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
par: Wu, Hang, et autres
Publié: (2025)
par: Wu, Hang, et autres
Publié: (2025)
Learning Disentangled Representation for One-shot Progressive Face Swapping
par: Li, Qi, et autres
Publié: (2022)
par: Li, Qi, et autres
Publié: (2022)
Stable Part Diffusion 4D: Multi-View RGB and Kinematic Parts Video Generation
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs
par: Dalal, Dwip, et autres
Publié: (2025)
par: Dalal, Dwip, et autres
Publié: (2025)
CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination
par: Yang, Kaicheng, et autres
Publié: (2024)
par: Yang, Kaicheng, et autres
Publié: (2024)
Physically Aware 360$^\circ$ View Generation from a Single Image using Disentangled Scene Embeddings
par: KV, Karthikeya, et autres
Publié: (2025)
par: KV, Karthikeya, et autres
Publié: (2025)
SAMOFT: Robust Multi-Object Tracking via Region and Flow
par: Wang, Yanchao, et autres
Publié: (2026)
par: Wang, Yanchao, et autres
Publié: (2026)
Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition
par: Hu, Xiaodan, et autres
Publié: (2025)
par: Hu, Xiaodan, et autres
Publié: (2025)
Incremental Object Detection with CLIP
par: Huang, Ziyue, et autres
Publié: (2023)
par: Huang, Ziyue, et autres
Publié: (2023)
Cognitive Disentanglement for Referring Multi-Object Tracking
par: Liang, Shaofeng, et autres
Publié: (2025)
par: Liang, Shaofeng, et autres
Publié: (2025)
CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models
par: Jha, Samyak, et autres
Publié: (2026)
par: Jha, Samyak, et autres
Publié: (2026)
HENet: Hybrid Encoding for End-to-end Multi-task 3D Perception from Multi-view Cameras
par: Xia, Zhongyu, et autres
Publié: (2024)
par: Xia, Zhongyu, et autres
Publié: (2024)
MagicPose4D: Crafting Articulated Models with Appearance and Motion Control
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Efficient Video Object Segmentation via Modulated Cross-Attention Memory
par: Shaker, Abdelrahman, et autres
Publié: (2024)
par: Shaker, Abdelrahman, et autres
Publié: (2024)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
par: Xiao, Linhui, et autres
Publié: (2023)
par: Xiao, Linhui, et autres
Publié: (2023)
CLIP-RD: Relative Distillation for Efficient CLIP Knowledge Distillation
par: Chung, Jeannie, et autres
Publié: (2026)
par: Chung, Jeannie, et autres
Publié: (2026)
Piecewise-Linear Manifolds for Deep Metric Learning
par: Bhatnagar, Shubhang, et autres
Publié: (2024)
par: Bhatnagar, Shubhang, et autres
Publié: (2024)
Documents similaires
-
Finding Distributed Object-Centric Properties in Self-Supervised Transformers
par: Rawlekar, Samyak, et autres
Publié: (2026) -
Learning Implicit Representation for Reconstructing Articulated Objects
par: Zhang, Hao, et autres
Publié: (2024) -
S3O: A Dual-Phase Approach for Reconstructing Dynamic Shape and Skeleton of Articulated Objects from Single Monocular Video
par: Zhang, Hao, et autres
Publié: (2024) -
Rethinking Prompting Strategies for Multi-Label Recognition with Partial Annotations
par: Rawlekar, Samyak, et autres
Publié: (2024) -
Improving Multi-label Recognition using Class Co-Occurrence Probabilities
par: Rawlekar, Samyak, et autres
Publié: (2024)