Progress-Aware Video Frame Captioning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Zihui, An, Joungbin, Yang, Xitong, Grauman, Kristen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
par: An, Joungbin, et autres
Publié: (2025)
par: An, Joungbin, et autres
Publié: (2025)
UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
par: An, Joungbin, et autres
Publié: (2026)
par: An, Joungbin, et autres
Publié: (2026)
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
par: Xue, Zihui, et autres
Publié: (2024)
par: Xue, Zihui, et autres
Publié: (2024)
Learning Object State Changes in Videos: An Open-World Perspective
par: Xue, Zihui, et autres
Publié: (2023)
par: Xue, Zihui, et autres
Publié: (2023)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
par: Baid, Ami, et autres
Publié: (2026)
par: Baid, Ami, et autres
Publié: (2026)
SPOC: Spatially-Progressing Object State Change Segmentation in Video
par: Mandikal, Priyanka, et autres
Publié: (2025)
par: Mandikal, Priyanka, et autres
Publié: (2025)
Detours for Navigating Instructional Videos
par: Ashutosh, Kumar, et autres
Publié: (2024)
par: Ashutosh, Kumar, et autres
Publié: (2024)
Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric Videos
par: Luo, Mi, et autres
Publié: (2024)
par: Luo, Mi, et autres
Publié: (2024)
Seeing the Arrow of Time in Large Multimodal Models
par: Xue, Zihui, et autres
Publié: (2025)
par: Xue, Zihui, et autres
Publié: (2025)
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
par: Luo, Mi, et autres
Publié: (2025)
par: Luo, Mi, et autres
Publié: (2025)
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
par: Somayazulu, Arjun, et autres
Publié: (2026)
par: Somayazulu, Arjun, et autres
Publié: (2026)
Personal Visual Context Learning in Large Multimodal Models
par: Xue, Zihui, et autres
Publié: (2026)
par: Xue, Zihui, et autres
Publié: (2026)
Seeing without Pixels: Perception from Camera Trajectories
par: Xue, Zihui, et autres
Publié: (2025)
par: Xue, Zihui, et autres
Publié: (2025)
Learning Skill-Attributes for Transferable Assessment in Video
par: Ashutosh, Kumar, et autres
Publié: (2025)
par: Ashutosh, Kumar, et autres
Publié: (2025)
Vid2Coach: Transforming How-To Videos into Task Assistants
par: Huh, Mina, et autres
Publié: (2025)
par: Huh, Mina, et autres
Publié: (2025)
FIction: 4D Future Interaction Prediction from Video
par: Ashutosh, Kumar, et autres
Publié: (2024)
par: Ashutosh, Kumar, et autres
Publié: (2024)
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
par: Adebi, Daniel, et autres
Publié: (2025)
par: Adebi, Daniel, et autres
Publié: (2025)
Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos
par: Chen, Changan, et autres
Publié: (2024)
par: Chen, Changan, et autres
Publié: (2024)
Stitch-a-Demo: Video Demonstrations from Multistep Descriptions
par: Wu, Chi Hsuan, et autres
Publié: (2025)
par: Wu, Chi Hsuan, et autres
Publié: (2025)
EgoExo-WM: Unlocking Exo Video for Ego World Models
par: Tran, Danny, et autres
Publié: (2026)
par: Tran, Danny, et autres
Publié: (2026)
SportSkills: Physical Skill Learning from Sports Instructional Videos
par: Ashutosh, Kumar, et autres
Publié: (2026)
par: Ashutosh, Kumar, et autres
Publié: (2026)
Video ReCap: Recursive Captioning of Hour-Long Videos
par: Islam, Md Mohaiminul, et autres
Publié: (2024)
par: Islam, Md Mohaiminul, et autres
Publié: (2024)
LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning
par: Chao, Lianying, et autres
Publié: (2026)
par: Chao, Lianying, et autres
Publié: (2026)
MistExit: Learning to Exit for Early Mistake Detection in Procedural Videos
par: Majumder, Sagnik, et autres
Publié: (2026)
par: Majumder, Sagnik, et autres
Publié: (2026)
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
par: Majumder, Sagnik, et autres
Publié: (2024)
par: Majumder, Sagnik, et autres
Publié: (2024)
ExpertAF: Expert Actionable Feedback from Video
par: Ashutosh, Kumar, et autres
Publié: (2024)
par: Ashutosh, Kumar, et autres
Publié: (2024)
SkillSight: Efficient First-Person Skill Assessment with Gaze
par: Wu, Chi Hsuan, et autres
Publié: (2025)
par: Wu, Chi Hsuan, et autres
Publié: (2025)
Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos
par: Majumder, Sagnik, et autres
Publié: (2024)
par: Majumder, Sagnik, et autres
Publié: (2024)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
par: Majumder, Sagnik, et autres
Publié: (2023)
par: Majumder, Sagnik, et autres
Publié: (2023)
Frame-Level Captions for Long Video Generation with Complex Multi Scenes
par: Zheng, Guangcong, et autres
Publié: (2025)
par: Zheng, Guangcong, et autres
Publié: (2025)
ActionSwitch: Class-agnostic Detection of Simultaneous Actions in Streaming Videos
par: Kang, Hyolim, et autres
Publié: (2024)
par: Kang, Hyolim, et autres
Publié: (2024)
Few-View Object Reconstruction with Unknown Categories and Camera Poses
par: Jiang, Hanwen, et autres
Publié: (2022)
par: Jiang, Hanwen, et autres
Publié: (2022)
Object Aware Egocentric Online Action Detection
par: An, Joungbin, et autres
Publié: (2024)
par: An, Joungbin, et autres
Publié: (2024)
Mash, Spread, Slice! Learning to Manipulate Object States via Visual Spatial Progress
par: Mandikal, Priyanka, et autres
Publié: (2025)
par: Mandikal, Priyanka, et autres
Publié: (2025)
Narrating the Video: Boosting Text-Video Retrieval via Comprehensive Utilization of Frame-Level Captions
par: Hur, Chan, et autres
Publié: (2025)
par: Hur, Chan, et autres
Publié: (2025)
PMQ-VE: Progressive Multi-Frame Quantization for Video Enhancement
par: Feng, ZhanFeng, et autres
Publié: (2025)
par: Feng, ZhanFeng, et autres
Publié: (2025)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
par: Jeon, MinJu, et autres
Publié: (2025)
par: Jeon, MinJu, et autres
Publié: (2025)
From Captions to Keyframes: KeyScore for Multimodal Frame Scoring and Video-Language Understanding
par: Lin, Shih-Yao, et autres
Publié: (2025)
par: Lin, Shih-Yao, et autres
Publié: (2025)
Motion-Aware Video Frame Interpolation
par: Han, Pengfei, et autres
Publié: (2024)
par: Han, Pengfei, et autres
Publié: (2024)
Capturing Rich Behavior Representations: A Dynamic Action Semantic-Aware Graph Transformer for Video Captioning
par: Liu, Caihua, et autres
Publié: (2025)
par: Liu, Caihua, et autres
Publié: (2025)
Documents similaires
-
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
par: An, Joungbin, et autres
Publié: (2025) -
UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
par: An, Joungbin, et autres
Publié: (2026) -
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
par: Xue, Zihui, et autres
Publié: (2024) -
Learning Object State Changes in Videos: An Open-World Perspective
par: Xue, Zihui, et autres
Publié: (2023) -
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
par: Baid, Ami, et autres
Publié: (2026)