ActionVOS: Actions as Prompts for Video Object Segmentation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ouyang, Liangyang, Liu, Ruicong, Huang, Yifei, Furuta, Ryosuke, Sato, Yoichi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Egocentric Action-aware Inertial Localization in Point Clouds with Vision-Language Guidance
par: Zhang, Mingfang, et autres
Publié: (2025)
par: Zhang, Mingfang, et autres
Publié: (2025)
SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation
par: Ouyang, Liangyang, et autres
Publié: (2026)
par: Ouyang, Liangyang, et autres
Publié: (2026)
SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting
par: Liu, Ruicong, et autres
Publié: (2025)
par: Liu, Ruicong, et autres
Publié: (2025)
Masked Video and Body-worn IMU Autoencoder for Egocentric Action Recognition
par: Zhang, Mingfang, et autres
Publié: (2024)
par: Zhang, Mingfang, et autres
Publié: (2024)
Multi-speaker Attention Alignment for Multimodal Social Interaction
par: Ouyang, Liangyang, et autres
Publié: (2025)
par: Ouyang, Liangyang, et autres
Publié: (2025)
Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions
par: Kang, Caixin, et autres
Publié: (2025)
par: Kang, Caixin, et autres
Publié: (2025)
Learning Multiple Object States from Actions via Large Language Models
par: Tateno, Masatoshi, et autres
Publié: (2024)
par: Tateno, Masatoshi, et autres
Publié: (2024)
Seeking Flat Minima with Mean Teacher on Semi- and Weakly-Supervised Domain Generalization for Object Detection
par: Furuta, Ryosuke, et autres
Publié: (2023)
par: Furuta, Ryosuke, et autres
Publié: (2023)
Leadership Assessment in Pediatric Intensive Care Unit Team Training
par: Ouyang, Liangyang, et autres
Publié: (2025)
par: Ouyang, Liangyang, et autres
Publié: (2025)
AssemblyHands-X: Modeling 3D Hand-Body Coordination for Understanding Bimanual Human Activities
par: Banno, Tatsuro, et autres
Publié: (2025)
par: Banno, Tatsuro, et autres
Publié: (2025)
Can MLLMs Read the Room? A Multimodal Benchmark for Verifying Truthfulness in Multi-Party Social Interactions
par: Kang, Caixin, et autres
Publié: (2025)
par: Kang, Caixin, et autres
Publié: (2025)
EgoInstruct: An Egocentric Video Dataset of Face-to-face Instructional Interactions with Multi-modal LLM Benchmarking
par: Sakai, Yuki, et autres
Publié: (2025)
par: Sakai, Yuki, et autres
Publié: (2025)
FineBio: A Fine-Grained Video Dataset of Biological Experiments with Hierarchical Annotation
par: Yagi, Takuma, et autres
Publié: (2024)
par: Yagi, Takuma, et autres
Publié: (2024)
Pre-Training for 3D Hand Pose Estimation with Contrastive Learning on Large-Scale Hand Images in the Wild
par: Lin, Nie, et autres
Publié: (2024)
par: Lin, Nie, et autres
Publié: (2024)
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
par: Kang, Caixin, et autres
Publié: (2026)
par: Kang, Caixin, et autres
Publié: (2026)
ClickVOS: Click Video Object Segmentation
par: Guo, Pinxue, et autres
Publié: (2024)
par: Guo, Pinxue, et autres
Publié: (2024)
EgoBrain: Synergizing Minds and Eyes For Human Action Understanding
par: Lin, Nie, et autres
Publié: (2025)
par: Lin, Nie, et autres
Publié: (2025)
Single-to-Dual-View Adaptation for Egocentric 3D Hand Pose Estimation
par: Liu, Ruicong, et autres
Publié: (2024)
par: Liu, Ruicong, et autres
Publié: (2024)
Point-VOS: Pointing Up Video Object Segmentation
par: Zulfikar, Idil Esen, et autres
Publié: (2024)
par: Zulfikar, Idil Esen, et autres
Publié: (2024)
SiMHand: Mining Similar Hands for Large-Scale 3D Hand Pose Pre-training
par: Lin, Nie, et autres
Publié: (2025)
par: Lin, Nie, et autres
Publié: (2025)
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
par: Ohkawa, Takehiko, et autres
Publié: (2023)
par: Ohkawa, Takehiko, et autres
Publié: (2023)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
par: Ouyang, Liangyang, et autres
Publié: (2025)
par: Ouyang, Liangyang, et autres
Publié: (2025)
Inference-time Trajectory Optimization for Manga Image Editing
par: Furuta, Ryosuke
Publié: (2026)
par: Furuta, Ryosuke
Publié: (2026)
The N-Body Problem: Parallel Execution from Single-Person Egocentric Video
par: Zhu, Zhifan, et autres
Publié: (2025)
par: Zhu, Zhifan, et autres
Publié: (2025)
DeVOS: Flow-Guided Deformable Transformer for Video Object Segmentation
par: Fedynyak, Volodymyr, et autres
Publié: (2024)
par: Fedynyak, Volodymyr, et autres
Publié: (2024)
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
par: Suzuki, Naru, et autres
Publié: (2025)
par: Suzuki, Naru, et autres
Publié: (2025)
Learning Gaussian Data Augmentation in Feature Space for One-shot Object Detection in Manga
par: Taniguchi, Takara, et autres
Publié: (2024)
par: Taniguchi, Takara, et autres
Publié: (2024)
OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework
par: Li, Wanyun, et autres
Publié: (2024)
par: Li, Wanyun, et autres
Publié: (2024)
UW-VOS: A Large-Scale Dataset for Underwater Video Object Segmentation
par: Zhao, Hongshen, et autres
Publié: (2026)
par: Zhao, Hongshen, et autres
Publié: (2026)
Precise Action-to-Video Generation Through Visual Action Prompts
par: Wang, Yuang, et autres
Publié: (2025)
par: Wang, Yuang, et autres
Publié: (2025)
Video Object Segmentation via SAM 2: The 4th Solution for LSVOS Challenge VOS Track
par: Pan, Feiyu, et autres
Publié: (2024)
par: Pan, Feiyu, et autres
Publié: (2024)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
par: Guo, Pinxue, et autres
Publié: (2024)
par: Guo, Pinxue, et autres
Publié: (2024)
Hierarchical Action Learning for Weakly-Supervised Action Segmentation
par: Huang, Junxian, et autres
Publié: (2026)
par: Huang, Junxian, et autres
Publié: (2026)
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2024)
par: Lin, Ci-Siang, et autres
Publié: (2024)
Leveraging RGB Images for Pre-Training of Event-Based Hand Pose Estimation
par: Liu, Ruicong, et autres
Publié: (2025)
par: Liu, Ruicong, et autres
Publié: (2025)
SCP: Soft Conditional Prompt Learning for Aerial Video Action Recognition
par: Wang, Xijun, et autres
Publié: (2023)
par: Wang, Xijun, et autres
Publié: (2023)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2025)
par: Lin, Ci-Siang, et autres
Publié: (2025)
Joint Self-Supervised Video Alignment and Action Segmentation
par: Ali, Ali Shah, et autres
Publié: (2025)
par: Ali, Ali Shah, et autres
Publié: (2025)
Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling
par: Kang, Taewon, et autres
Publié: (2025)
par: Kang, Taewon, et autres
Publié: (2025)
Documents similaires
-
Egocentric Action-aware Inertial Localization in Point Clouds with Vision-Language Guidance
par: Zhang, Mingfang, et autres
Publié: (2025) -
SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation
par: Ouyang, Liangyang, et autres
Publié: (2026) -
SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting
par: Liu, Ruicong, et autres
Publié: (2025) -
Masked Video and Body-worn IMU Autoencoder for Egocentric Action Recognition
par: Zhang, Mingfang, et autres
Publié: (2024) -
Multi-speaker Attention Alignment for Multimodal Social Interaction
par: Ouyang, Liangyang, et autres
Publié: (2025)