VINO: Video-driven Invariance for Non-contextual Objects via Structural Prior Guided De-contextualization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yeom, Seul-Ki, Simon, Marcel, Lee, Eunbin, Kim, Tae-Ho |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Video Self-Distillation for Single-Image Encoders: A Step Toward Physically Plausible Perception
par: Simon, Marcel, et autres
Publié: (2025)
par: Simon, Marcel, et autres
Publié: (2025)
UniForm: A Reuse Attention Mechanism Optimized for Efficient Vision Transformers on Edge Devices
par: Yeom, Seul-Ki, et autres
Publié: (2024)
par: Yeom, Seul-Ki, et autres
Publié: (2024)
Zero-shot Depth Completion via Test-time Alignment with Affine-invariant Depth Prior
par: Hyoseok, Lee, et autres
Publié: (2025)
par: Hyoseok, Lee, et autres
Publié: (2025)
Consistent text-to-image generation via scene de-contextualization
par: Tang, Song, et autres
Publié: (2025)
par: Tang, Song, et autres
Publié: (2025)
VisTa: Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection
par: Zhang, Bin, et autres
Publié: (2025)
par: Zhang, Bin, et autres
Publié: (2025)
Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities
par: Piergiovanni, AJ, et autres
Publié: (2023)
par: Piergiovanni, AJ, et autres
Publié: (2023)
Exploring contextual modeling with linear complexity for point cloud segmentation
par: Chng, Yong Xien, et autres
Publié: (2024)
par: Chng, Yong Xien, et autres
Publié: (2024)
VideoMaMa: Mask-Guided Video Matting via Generative Prior
par: Lim, Sangbeom, et autres
Publié: (2026)
par: Lim, Sangbeom, et autres
Publié: (2026)
Guided Slot Attention for Unsupervised Video Object Segmentation
par: Lee, Minhyeok, et autres
Publié: (2023)
par: Lee, Minhyeok, et autres
Publié: (2023)
Temporal-contextual Event Learning for Pedestrian Crossing Intent Prediction
par: Liang, Hongbin, et autres
Publié: (2025)
par: Liang, Hongbin, et autres
Publié: (2025)
SLGNet: Synergizing Structural Priors and Language-Guided Modulation for Multimodal Object Detection
par: Xiang, Xiantai, et autres
Publié: (2026)
par: Xiang, Xiantai, et autres
Publié: (2026)
A low complexity contextual stacked ensemble-learning approach for pedestrian intent prediction
par: Chiang, Chia-Yen, et autres
Publié: (2024)
par: Chiang, Chia-Yen, et autres
Publié: (2024)
SituationalLLM: Proactive language models with scene awareness for dynamic, contextual task guidance
par: Khan, Muhammad Saif Ullah, et autres
Publié: (2024)
par: Khan, Muhammad Saif Ullah, et autres
Publié: (2024)
3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation
par: Kim, Hwidong, et autres
Publié: (2026)
par: Kim, Hwidong, et autres
Publié: (2026)
Exploiting Diffusion Prior for Task-driven Image Restoration
par: Kim, Jaeha, et autres
Publié: (2025)
par: Kim, Jaeha, et autres
Publié: (2025)
DepthFlow: Exploiting Depth-Flow Structural Correlations for Unsupervised Video Object Segmentation
par: Cho, Suhwan, et autres
Publié: (2025)
par: Cho, Suhwan, et autres
Publié: (2025)
DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation
par: Kim, Hyeonwoo, et autres
Publié: (2026)
par: Kim, Hyeonwoo, et autres
Publié: (2026)
Improving Unsupervised Video Object Segmentation via Fake Flow Generation
par: Cho, Suhwan, et autres
Publié: (2024)
par: Cho, Suhwan, et autres
Publié: (2024)
Learning an Ensemble Token from Task-driven Priors in Facial Analysis
par: Seo, Sunyong, et autres
Publié: (2025)
par: Seo, Sunyong, et autres
Publié: (2025)
DeVOS: Flow-Guided Deformable Transformer for Video Object Segmentation
par: Fedynyak, Volodymyr, et autres
Publié: (2024)
par: Fedynyak, Volodymyr, et autres
Publié: (2024)
Putting the Object Back into Video Object Segmentation
par: Cheng, Ho Kei, et autres
Publié: (2023)
par: Cheng, Ho Kei, et autres
Publié: (2023)
Controllable Video Object Insertion via Multiview Priors
par: Qi, Xia, et autres
Publié: (2026)
par: Qi, Xia, et autres
Publié: (2026)
ObjectMover: Generative Object Movement with Video Prior
par: Yu, Xin, et autres
Publié: (2025)
par: Yu, Xin, et autres
Publié: (2025)
PriorNet: Prior-Guided Engagement Estimation from Face Video
par: Vedernikov, Alexander
Publié: (2026)
par: Vedernikov, Alexander
Publié: (2026)
Boosting Micro-Expression Analysis via Prior-Guided Video-Level Regression
par: Guo, Zizheng, et autres
Publié: (2025)
par: Guo, Zizheng, et autres
Publié: (2025)
Language-Guided Invariance Probing of Vision-Language Models
par: Lee, Jae Joong
Publié: (2025)
par: Lee, Jae Joong
Publié: (2025)
APGNet: Adaptive Prior-Guided for Underwater Camouflaged Object Detection
par: Huang, Xinxin, et autres
Publié: (2025)
par: Huang, Xinxin, et autres
Publié: (2025)
HeightLane: BEV Heightmap guided 3D Lane Detection
par: Park, Chaesong, et autres
Publié: (2024)
par: Park, Chaesong, et autres
Publié: (2024)
Coding-Prior Guided Diffusion Network for Video Deblurring
par: Liu, Yike, et autres
Publié: (2025)
par: Liu, Yike, et autres
Publié: (2025)
VideoHandles: Editing 3D Object Compositions in Videos Using Video Generative Priors
par: Koo, Juil, et autres
Publié: (2025)
par: Koo, Juil, et autres
Publié: (2025)
Dynamic Full-body Motion Agent with Object Interaction via Blending Pre-trained Modular Controllers
par: Nam, Sanghyeok, et autres
Publié: (2026)
par: Nam, Sanghyeok, et autres
Publié: (2026)
MSCoTDet: Language-driven Multi-modal Fusion for Improved Multispectral Pedestrian Detection
par: Kim, Taeheon, et autres
Publié: (2024)
par: Kim, Taeheon, et autres
Publié: (2024)
InterRVOS: Interaction-aware Referring Video Object Segmentation
par: Jin, Woojeong, et autres
Publié: (2025)
par: Jin, Woojeong, et autres
Publié: (2025)
PLOT: Pseudo-Labeling via Video Object Tracking for Scalable Monocular 3D Object Detection
par: Lee, Seokyeong, et autres
Publié: (2025)
par: Lee, Seokyeong, et autres
Publié: (2025)
Cooperative Inference for Real-Time 3D Human Pose Estimation in Multi-Device Edge Networks
par: Choi, Hyun-Ho, et autres
Publié: (2025)
par: Choi, Hyun-Ho, et autres
Publié: (2025)
Dual Prototype Attention for Unsupervised Video Object Segmentation
par: Cho, Suhwan, et autres
Publié: (2022)
par: Cho, Suhwan, et autres
Publié: (2022)
DeLTa: Demonstration and Language-Guided Novel Transparent Object Manipulation
par: Lee, Taeyeop, et autres
Publié: (2025)
par: Lee, Taeyeop, et autres
Publié: (2025)
Learning Object-Centric Representations in SAR Images with Multi-Level Feature Fusion
par: Jang, Oh-Tae, et autres
Publié: (2025)
par: Jang, Oh-Tae, et autres
Publié: (2025)
GALAR-TemporalNet v2: Anatomy-Guided Dual-Branch Temporal Classification with Bidirectional Mamba and Dual-Graph GCN for Video Capsule Endoscopy -- after competition results
par: Won, Jiye, et autres
Publié: (2026)
par: Won, Jiye, et autres
Publié: (2026)
Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning
par: Jung, Ji Hyeok, et autres
Publié: (2024)
par: Jung, Ji Hyeok, et autres
Publié: (2024)
Documents similaires
-
Video Self-Distillation for Single-Image Encoders: A Step Toward Physically Plausible Perception
par: Simon, Marcel, et autres
Publié: (2025) -
UniForm: A Reuse Attention Mechanism Optimized for Efficient Vision Transformers on Edge Devices
par: Yeom, Seul-Ki, et autres
Publié: (2024) -
Zero-shot Depth Completion via Test-time Alignment with Affine-invariant Depth Prior
par: Hyoseok, Lee, et autres
Publié: (2025) -
Consistent text-to-image generation via scene de-contextualization
par: Tang, Song, et autres
Publié: (2025) -
VisTa: Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection
par: Zhang, Bin, et autres
Publié: (2025)