Beyond Play and Pause: Turning GPT-4o Spatial Weakness into a Strength for In-Depth Interactive Video Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Goudarzi, Sajad, Zamanifard, Samaneh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion
di: Singh, Shivam, et al.
Pubblicazione: (2026)
di: Singh, Shivam, et al.
Pubblicazione: (2026)
Playing to Vision Foundation Model's Strengths in Stereo Matching
di: Liu, Chuang-Wei, et al.
Pubblicazione: (2024)
di: Liu, Chuang-Wei, et al.
Pubblicazione: (2024)
Fast Adversarial Training with Weak-to-Strong Spatial-Temporal Consistency in the Frequency Domain on Videos
di: Wang, Songping, et al.
Pubblicazione: (2025)
di: Wang, Songping, et al.
Pubblicazione: (2025)
FlattenGPT: Depth Compression for Transformer with Layer Flattening
di: Xu, Ruihan, et al.
Pubblicazione: (2026)
di: Xu, Ruihan, et al.
Pubblicazione: (2026)
Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
di: Chen, Sili, et al.
Pubblicazione: (2025)
di: Chen, Sili, et al.
Pubblicazione: (2025)
Beyond Synthetic Replays: Turning Diffusion Features into Few-Shot Class-Incremental Learning Knowledge
di: Kim, Junsu, et al.
Pubblicazione: (2025)
di: Kim, Junsu, et al.
Pubblicazione: (2025)
Beyond Spatial Frequency: Pixel-wise Temporal Frequency-based Deepfake Video Detection
di: Kim, Taehoon, et al.
Pubblicazione: (2025)
di: Kim, Taehoon, et al.
Pubblicazione: (2025)
VTG-GPT: Tuning-Free Zero-Shot Video Temporal Grounding with GPT
di: Xu, Yifang, et al.
Pubblicazione: (2024)
di: Xu, Yifang, et al.
Pubblicazione: (2024)
Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
di: Xiao, Zeqi, et al.
Pubblicazione: (2025)
di: Xiao, Zeqi, et al.
Pubblicazione: (2025)
Video-GPT via Next Clip Diffusion
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o
di: Tong, Tony Cheng, et al.
Pubblicazione: (2024)
di: Tong, Tony Cheng, et al.
Pubblicazione: (2024)
Depth Any Video with Scalable Synthetic Data
di: Yang, Honghui, et al.
Pubblicazione: (2024)
di: Yang, Honghui, et al.
Pubblicazione: (2024)
Learning Spatial-Semantic Features for Robust Video Object Segmentation
di: Li, Xin, et al.
Pubblicazione: (2024)
di: Li, Xin, et al.
Pubblicazione: (2024)
Learning to Play Video Games with Intuitive Physics Priors
di: Jaiswal, Abhishek, et al.
Pubblicazione: (2024)
di: Jaiswal, Abhishek, et al.
Pubblicazione: (2024)
Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
di: Lai, Xin, et al.
Pubblicazione: (2025)
di: Lai, Xin, et al.
Pubblicazione: (2025)
Evaluation of GPT-4o and GPT-4o-mini's Vision Capabilities for Compositional Analysis from Dried Solution Drops
di: Dangi, Deven B., et al.
Pubblicazione: (2024)
di: Dangi, Deven B., et al.
Pubblicazione: (2024)
FOOTPASS: A Multi-Modal Multi-Agent Tactical Context Dataset for Play-by-Play Action Spotting in Soccer Broadcast Videos
di: Ochin, Jeremie, et al.
Pubblicazione: (2025)
di: Ochin, Jeremie, et al.
Pubblicazione: (2025)
GV-VAD : Exploring Video Generation for Weakly-Supervised Video Anomaly Detection
di: Cai, Suhang, et al.
Pubblicazione: (2025)
di: Cai, Suhang, et al.
Pubblicazione: (2025)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
di: Pan, Yaning, et al.
Pubblicazione: (2025)
di: Pan, Yaning, et al.
Pubblicazione: (2025)
VRAG: Learning World Models for Interactive Video Generation
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
Beyond Uncertainty: Evidential Deep Learning for Robust Video Temporal Grounding
di: Ma, Kaijing, et al.
Pubblicazione: (2024)
di: Ma, Kaijing, et al.
Pubblicazione: (2024)
GPT as Psychologist? Preliminary Evaluations for GPT-4V on Visual Affective Computing
di: Lu, Hao, et al.
Pubblicazione: (2024)
di: Lu, Hao, et al.
Pubblicazione: (2024)
3DAxisPrompt: Promoting the 3D Grounding and Reasoning in GPT-4o
di: Liu, Dingning, et al.
Pubblicazione: (2025)
di: Liu, Dingning, et al.
Pubblicazione: (2025)
DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation
di: Fu, Junhu, et al.
Pubblicazione: (2026)
di: Fu, Junhu, et al.
Pubblicazione: (2026)
Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4
di: Azizi, Vahid, et al.
Pubblicazione: (2024)
di: Azizi, Vahid, et al.
Pubblicazione: (2024)
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
di: Chen, Junying, et al.
Pubblicazione: (2025)
di: Chen, Junying, et al.
Pubblicazione: (2025)
I2VControl-Camera: Precise Video Camera Control with Adjustable Motion Strength
di: Feng, Wanquan, et al.
Pubblicazione: (2024)
di: Feng, Wanquan, et al.
Pubblicazione: (2024)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
di: Chen, Pingyi, et al.
Pubblicazione: (2025)
di: Chen, Pingyi, et al.
Pubblicazione: (2025)
Prompt fidelity of ChatGPT4o / Dall-E3 text-to-image visualisations
di: Spennemann, Dirk HR
Pubblicazione: (2025)
di: Spennemann, Dirk HR
Pubblicazione: (2025)
OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing
di: Chen, Zhihong, et al.
Pubblicazione: (2025)
di: Chen, Zhihong, et al.
Pubblicazione: (2025)
DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
di: Kim, Ye-Chan, et al.
Pubblicazione: (2026)
di: Kim, Ye-Chan, et al.
Pubblicazione: (2026)
NormEnsembleXAI: Unveiling the Strengths and Weaknesses of XAI Ensemble Techniques
di: Hryniewska-Guzik, Weronika, et al.
Pubblicazione: (2024)
di: Hryniewska-Guzik, Weronika, et al.
Pubblicazione: (2024)
Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks
di: Wang, Yufei, et al.
Pubblicazione: (2026)
di: Wang, Yufei, et al.
Pubblicazione: (2026)
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs
di: Alansari, Mohamad, et al.
Pubblicazione: (2026)
di: Alansari, Mohamad, et al.
Pubblicazione: (2026)
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision
di: Gupta, Ayush, et al.
Pubblicazione: (2025)
di: Gupta, Ayush, et al.
Pubblicazione: (2025)
Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts
di: Wu, Peng, et al.
Pubblicazione: (2024)
di: Wu, Peng, et al.
Pubblicazione: (2024)
Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
di: Ye, Junyan, et al.
Pubblicazione: (2025)
di: Ye, Junyan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion
di: Singh, Shivam, et al.
Pubblicazione: (2026) -
Playing to Vision Foundation Model's Strengths in Stereo Matching
di: Liu, Chuang-Wei, et al.
Pubblicazione: (2024) -
Fast Adversarial Training with Weak-to-Strong Spatial-Temporal Consistency in the Frequency Domain on Videos
di: Wang, Songping, et al.
Pubblicazione: (2025) -
FlattenGPT: Depth Compression for Transformer with Layer Flattening
di: Xu, Ruihan, et al.
Pubblicazione: (2026) -
Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
di: Chen, Sili, et al.
Pubblicazione: (2025)