From Imitation to Intuition: Intrinsic Reasoning for Open-Instance Video Classification
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Ke, Zhao, Xiangchen, Tian, Yunjie, Zheng, Jiayu, Patel, Vishal M., Fu, Di |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On-Policy Distillation with Best-of-N Teacher Rollout Selection
por: Zhang, Ke, et al.
Publicado: (2026)
por: Zhang, Ke, et al.
Publicado: (2026)
MedCL: Learning Consistent Anatomy Distribution for Scribble-supervised Medical Image Segmentation
por: Zhang, Ke, et al.
Publicado: (2025)
por: Zhang, Ke, et al.
Publicado: (2025)
ModelMix: A New Model-Mixup Strategy to Minimize Vicinal Risk across Tasks for Few-scribble based Cardiac Segmentation
por: Zhang, Ke, et al.
Publicado: (2024)
por: Zhang, Ke, et al.
Publicado: (2024)
FreeViS: Training-free Video Stylization with Inconsistent References
por: Xu, Jiacong, et al.
Publicado: (2025)
por: Xu, Jiacong, et al.
Publicado: (2025)
Endless World: Real-Time 3D-Aware Long Video Generation
por: Zhang, Ke, et al.
Publicado: (2025)
por: Zhang, Ke, et al.
Publicado: (2025)
RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification
por: Xu, Meilong, et al.
Publicado: (2025)
por: Xu, Meilong, et al.
Publicado: (2025)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
Hyp-OC: Hyperbolic One Class Classification for Face Anti-Spoofing
por: Narayan, Kartik, et al.
Publicado: (2024)
por: Narayan, Kartik, et al.
Publicado: (2024)
Think Before You Diffuse: Infusing Physical Rules into Video Diffusion
por: Zhang, Ke, et al.
Publicado: (2025)
por: Zhang, Ke, et al.
Publicado: (2025)
OpenVIS: Open-vocabulary Video Instance Segmentation
por: Guo, Pinxue, et al.
Publicado: (2023)
por: Guo, Pinxue, et al.
Publicado: (2023)
Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation
por: Chu, Ernie, et al.
Publicado: (2026)
por: Chu, Ernie, et al.
Publicado: (2026)
Histomorphology-Guided Prototypical Multi-Instance Learning for Breast Cancer WSI Classification
por: Wang, Baizhi, et al.
Publicado: (2025)
por: Wang, Baizhi, et al.
Publicado: (2025)
Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors
por: Wang, Xiangchen, et al.
Publicado: (2025)
por: Wang, Xiangchen, et al.
Publicado: (2025)
Unified Embedding Alignment for Open-Vocabulary Video Instance Segmentation
por: Fang, Hao, et al.
Publicado: (2024)
por: Fang, Hao, et al.
Publicado: (2024)
Face-to-Face: A Video Dataset for Multi-Person Interaction Modeling
por: Chu, Ernie, et al.
Publicado: (2026)
por: Chu, Ernie, et al.
Publicado: (2026)
Frame by Familiar Frame: Understanding Replication in Video Diffusion Models
por: Rahman, Aimon, et al.
Publicado: (2024)
por: Rahman, Aimon, et al.
Publicado: (2024)
From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing
por: Zhang, Haoyuan, et al.
Publicado: (2026)
por: Zhang, Haoyuan, et al.
Publicado: (2026)
SyncVIS: Synchronized Video Instance Segmentation
por: Zheng, Rongkun, et al.
Publicado: (2024)
por: Zheng, Rongkun, et al.
Publicado: (2024)
Towards Real-Time Open-Vocabulary Video Instance Segmentation
por: Yan, Bin, et al.
Publicado: (2024)
por: Yan, Bin, et al.
Publicado: (2024)
InstanceV: Instance-Level Video Generation
por: Chen, Yuheng, et al.
Publicado: (2025)
por: Chen, Yuheng, et al.
Publicado: (2025)
Unsupervised Open-Vocabulary Object Localization in Videos
por: Fan, Ke, et al.
Publicado: (2023)
por: Fan, Ke, et al.
Publicado: (2023)
Image-to-Video Diffusion: From Foundations to Open Frontiers
por: Wang, Xianlong, et al.
Publicado: (2026)
por: Wang, Xianlong, et al.
Publicado: (2026)
Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators
por: Zhang, Wentao, et al.
Publicado: (2024)
por: Zhang, Wentao, et al.
Publicado: (2024)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Dense Multimodal Alignment for Open-Vocabulary 3D Scene Understanding
por: Li, Ruihuang, et al.
Publicado: (2024)
por: Li, Ruihuang, et al.
Publicado: (2024)
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
por: Zhu, Wenqi, et al.
Publicado: (2024)
por: Zhu, Wenqi, et al.
Publicado: (2024)
Polymorph: Energy-Efficient Multi-Label Classification for Video Streams on Embedded Devices
por: Ghafouri, Saeid, et al.
Publicado: (2025)
por: Ghafouri, Saeid, et al.
Publicado: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
por: Wei, Yana, et al.
Publicado: (2025)
por: Wei, Yana, et al.
Publicado: (2025)
InstanceAnimator: Multi-Instance Sketch Video Colorization
por: Zhang, Yinhan, et al.
Publicado: (2026)
por: Zhang, Yinhan, et al.
Publicado: (2026)
Details Matter for Indoor Open-vocabulary 3D Instance Segmentation
por: Jung, Sanghun, et al.
Publicado: (2025)
por: Jung, Sanghun, et al.
Publicado: (2025)
VideoSAM: Open-World Video Segmentation
por: Guo, Pinxue, et al.
Publicado: (2024)
por: Guo, Pinxue, et al.
Publicado: (2024)
AWRaCLe: All-Weather Image Restoration using Visual In-Context Learning
por: Rajagopalan, Sudarshan, et al.
Publicado: (2024)
por: Rajagopalan, Sudarshan, et al.
Publicado: (2024)
Low-rank Adaptation-based All-Weather Removal for Autonomous Navigation
por: Rajagopalan, Sudarshan, et al.
Publicado: (2024)
por: Rajagopalan, Sudarshan, et al.
Publicado: (2024)
RemoteVAR: Autoregressive Visual Modeling for Remote Sensing Change Detection
por: Korkmaz, Yilmaz, et al.
Publicado: (2026)
por: Korkmaz, Yilmaz, et al.
Publicado: (2026)
Active Learning for Vision-Language Models
por: Safaei, Bardia, et al.
Publicado: (2024)
por: Safaei, Bardia, et al.
Publicado: (2024)
Implicit Neural Representations: A Signal Processing Perspective
por: Jayasundara, Dhananjaya, et al.
Publicado: (2026)
por: Jayasundara, Dhananjaya, et al.
Publicado: (2026)
iMOVE: Instance-Motion-Aware Video Understanding
por: Li, Jiaze, et al.
Publicado: (2025)
por: Li, Jiaze, et al.
Publicado: (2025)
ViLa-MIL: Dual-scale Vision-Language Multiple Instance Learning for Whole Slide Image Classification
por: Shi, Jiangbo, et al.
Publicado: (2025)
por: Shi, Jiangbo, et al.
Publicado: (2025)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
por: Tang, Yolo Yunlong, et al.
Publicado: (2023)
por: Tang, Yolo Yunlong, et al.
Publicado: (2023)
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
por: Zhang, Xiaowen, et al.
Publicado: (2026)
por: Zhang, Xiaowen, et al.
Publicado: (2026)
Ejemplares similares
-
On-Policy Distillation with Best-of-N Teacher Rollout Selection
por: Zhang, Ke, et al.
Publicado: (2026) -
MedCL: Learning Consistent Anatomy Distribution for Scribble-supervised Medical Image Segmentation
por: Zhang, Ke, et al.
Publicado: (2025) -
ModelMix: A New Model-Mixup Strategy to Minimize Vicinal Risk across Tasks for Few-scribble based Cardiac Segmentation
por: Zhang, Ke, et al.
Publicado: (2024) -
FreeViS: Training-free Video Stylization with Inconsistent References
por: Xu, Jiacong, et al.
Publicado: (2025) -
Endless World: Real-Time 3D-Aware Long Video Generation
por: Zhang, Ke, et al.
Publicado: (2025)