VideoSAVi: Self-Aligned Video Language Models without Human Supervision
Fuente:
arXiv
Guardado en:
| Autores principales: | Kulkarni, Yogesh, Fazli, Pooyan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VideoPASTA: 7K Preference Pairs That Matter for Video-LLM Alignment
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
por: Li, Chaoyu, et al.
Publicado: (2025)
por: Li, Chaoyu, et al.
Publicado: (2025)
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
por: Li, Chaoyu, et al.
Publicado: (2024)
por: Li, Chaoyu, et al.
Publicado: (2024)
VideoA11y: Method and Dataset for Accessible Video Description
por: Li, Chaoyu, et al.
Publicado: (2025)
por: Li, Chaoyu, et al.
Publicado: (2025)
ChartQA-X: Generating Explanations for Visual Chart Reasoning
por: Hegde, Shamanthak, et al.
Publicado: (2025)
por: Hegde, Shamanthak, et al.
Publicado: (2025)
Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding
por: Kumar, Akash, et al.
Publicado: (2025)
por: Kumar, Akash, et al.
Publicado: (2025)
A Large-Scale Analysis on Contextual Self-Supervised Video Representation Learning
por: Kumar, Akash, et al.
Publicado: (2025)
por: Kumar, Akash, et al.
Publicado: (2025)
Aligning Moments in Time using Video Queries
por: Kumar, Yogesh, et al.
Publicado: (2025)
por: Kumar, Yogesh, et al.
Publicado: (2025)
SAViL-Det: Semantic-Aware Vision-Language Model for Multi-Script Text Detection
por: Zighem, Mohammed-En-Nadhir, et al.
Publicado: (2025)
por: Zighem, Mohammed-En-Nadhir, et al.
Publicado: (2025)
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
por: Wang, Chenting, et al.
Publicado: (2025)
por: Wang, Chenting, et al.
Publicado: (2025)
FrameOracle: Learning What to See and How Much to See in Videos
por: Li, Chaoyu, et al.
Publicado: (2025)
por: Li, Chaoyu, et al.
Publicado: (2025)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
por: Kumar, Yogesh
Publicado: (2025)
por: Kumar, Yogesh
Publicado: (2025)
An Empirical Study of Accuracy-Robustness Tradeoff and Training Efficiency in Self-Supervised Learning
por: Ghofrani, Fatemeh, et al.
Publicado: (2025)
por: Ghofrani, Fatemeh, et al.
Publicado: (2025)
VideoSSR: Video Self-Supervised Reinforcement Learning
por: He, Zefeng, et al.
Publicado: (2025)
por: He, Zefeng, et al.
Publicado: (2025)
CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation
por: Li, Chaoyu, et al.
Publicado: (2026)
por: Li, Chaoyu, et al.
Publicado: (2026)
Video Depth without Video Models
por: Ke, Bingxin, et al.
Publicado: (2024)
por: Ke, Bingxin, et al.
Publicado: (2024)
Aligning Anime Video Generation with Human Feedback
por: Zhu, Bingwen, et al.
Publicado: (2025)
por: Zhu, Bingwen, et al.
Publicado: (2025)
Video-Bench: Human-Aligned Video Generation Benchmark
por: Han, Hui, et al.
Publicado: (2025)
por: Han, Hui, et al.
Publicado: (2025)
Human-Aligned Generative Perception: Bridging Psychophysics and Generative Models
por: Titikhsha, Antara, et al.
Publicado: (2025)
por: Titikhsha, Antara, et al.
Publicado: (2025)
Behavioral Geometric Supervision Aligns Video Foundation Models with Human Social Perception
por: Garcia, Kathy, et al.
Publicado: (2025)
por: Garcia, Kathy, et al.
Publicado: (2025)
Language-Guided Self-Supervised Video Summarization Using Text Semantic Matching Considering the Diversity of the Video
por: Sugihara, Tomoya, et al.
Publicado: (2024)
por: Sugihara, Tomoya, et al.
Publicado: (2024)
VideoClusterNet: Self-Supervised and Adaptive Face Clustering For Videos
por: Walawalkar, Devesh, et al.
Publicado: (2024)
por: Walawalkar, Devesh, et al.
Publicado: (2024)
Aligning Effective Tokens with Video Anomaly in Large Language Models
por: Chen, Yingxian, et al.
Publicado: (2025)
por: Chen, Yingxian, et al.
Publicado: (2025)
SelfHVD: Self-Supervised Handheld Video Deblurring
por: Xu, Honglei, et al.
Publicado: (2025)
por: Xu, Honglei, et al.
Publicado: (2025)
How Effective are Self-Supervised Models for Contact Identification in Videos
por: Gunawardhana, Malitha, et al.
Publicado: (2024)
por: Gunawardhana, Malitha, et al.
Publicado: (2024)
Self-Supervised Video Desmoking for Laparoscopic Surgery
por: Wu, Renlong, et al.
Publicado: (2024)
por: Wu, Renlong, et al.
Publicado: (2024)
Self-Supervised Animal Identification for Long Videos
por: Fang, Xuyang, et al.
Publicado: (2026)
por: Fang, Xuyang, et al.
Publicado: (2026)
Finding Optimal Video Moment without Training: Gaussian Boundary Optimization for Weakly Supervised Video Grounding
por: Kim, Sunoh, et al.
Publicado: (2026)
por: Kim, Sunoh, et al.
Publicado: (2026)
GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling
por: Shekhar, Shivanshu, et al.
Publicado: (2026)
por: Shekhar, Shivanshu, et al.
Publicado: (2026)
Advancing Video Self-Supervised Learning via Image Foundation Models
por: Wu, Jingwei, et al.
Publicado: (2025)
por: Wu, Jingwei, et al.
Publicado: (2025)
Reshoot-Anything: A Self-Supervised Model for In-the-Wild Video Reshooting
por: Paliwal, Avinash, et al.
Publicado: (2026)
por: Paliwal, Avinash, et al.
Publicado: (2026)
SPKLIP: Aligning Spike Video Streams with Natural Language
por: Gao, Yongchang, et al.
Publicado: (2025)
por: Gao, Yongchang, et al.
Publicado: (2025)
VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale
por: Kulkarni, Parth Parag, et al.
Publicado: (2026)
por: Kulkarni, Parth Parag, et al.
Publicado: (2026)
CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders
por: Ahamed, Shihab Aaqil, et al.
Publicado: (2025)
por: Ahamed, Shihab Aaqil, et al.
Publicado: (2025)
Joint Self-Supervised Video Alignment and Action Segmentation
por: Ali, Ali Shah, et al.
Publicado: (2025)
por: Ali, Ali Shah, et al.
Publicado: (2025)
ISR-DPO: Aligning Large Multimodal Models for Videos by Iterative Self-Retrospective DPO
por: Ahn, Daechul, et al.
Publicado: (2024)
por: Ahn, Daechul, et al.
Publicado: (2024)
VideoLLM Benchmarks and Evaluation: A Survey
por: Kumar, Yogesh
Publicado: (2025)
por: Kumar, Yogesh
Publicado: (2025)
FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning
por: Hu, Shiyu, et al.
Publicado: (2024)
por: Hu, Shiyu, et al.
Publicado: (2024)
Ejemplares similares
-
VideoPASTA: 7K Preference Pairs That Matter for Video-LLM Alignment
por: Kulkarni, Yogesh, et al.
Publicado: (2025) -
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
por: Kulkarni, Yogesh, et al.
Publicado: (2025) -
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video
por: Kulkarni, Yogesh, et al.
Publicado: (2025) -
ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
por: Li, Chaoyu, et al.
Publicado: (2025) -
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
por: Li, Chaoyu, et al.
Publicado: (2024)