FrameOracle: Learning What to See and How Much to See in Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Chaoyu, Li, Tianzhi, Tao, Fei, Zhao, Zhenyu, Wu, Ziqian, Zhao, Maozheng, Song, Juntong, Niu, Cheng, Fazli, Pooyan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
por: Li, Chaoyu, et al.
Publicado: (2025)
por: Li, Chaoyu, et al.
Publicado: (2025)
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
por: Li, Chaoyu, et al.
Publicado: (2024)
por: Li, Chaoyu, et al.
Publicado: (2024)
CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation
por: Li, Chaoyu, et al.
Publicado: (2026)
por: Li, Chaoyu, et al.
Publicado: (2026)
VideoA11y: Method and Dataset for Accessible Video Description
por: Li, Chaoyu, et al.
Publicado: (2025)
por: Li, Chaoyu, et al.
Publicado: (2025)
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
VideoSAVi: Self-Aligned Video Language Models without Human Supervision
por: Kulkarni, Yogesh, et al.
Publicado: (2024)
por: Kulkarni, Yogesh, et al.
Publicado: (2024)
VideoPASTA: 7K Preference Pairs That Matter for Video-LLM Alignment
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
See What I See: An Attention-Guiding eHMI Approach for Autonomous Vehicles
por: Li, Jialong, et al.
Publicado: (2026)
por: Li, Jialong, et al.
Publicado: (2026)
How Much Distortion We See in the Cyberspace: Geometric Assessment of Smartphone Photography
por: Shuqi Yang, et al.
Publicado: (2025)
por: Shuqi Yang, et al.
Publicado: (2025)
Vision Language Models See What You Want but not What You See
por: Gao, Qingying, et al.
Publicado: (2024)
por: Gao, Qingying, et al.
Publicado: (2024)
See How They Learn!
por: Koontz, Elizabeth D., et al.
Publicado: (1969)
por: Koontz, Elizabeth D., et al.
Publicado: (1969)
How Much Is Too Much? Adaptive, Context-Aware Risk Detection in Naturalistic Driving
por: Kalantari, Amir Hossein, et al.
Publicado: (2025)
por: Kalantari, Amir Hossein, et al.
Publicado: (2025)
Aligning What EEG Can See: Structural Representations for Brain-Vision Matching
por: Tang, Jingyi, et al.
Publicado: (2026)
por: Tang, Jingyi, et al.
Publicado: (2026)
LensWalk: Agentic Video Understanding by Planning How You See in Videos
por: Li, Keliang, et al.
Publicado: (2026)
por: Li, Keliang, et al.
Publicado: (2026)
Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
por: Xuan, Weihao, et al.
Publicado: (2025)
por: Xuan, Weihao, et al.
Publicado: (2025)
Seeing Fast and Slow: Learning the Flow of Time in Videos
por: Wu, Yen-Siang, et al.
Publicado: (2026)
por: Wu, Yen-Siang, et al.
Publicado: (2026)
Trusting What You Cannot See: Auditable Fine-Tuning and Inference for Proprietary AI
por: Jin, Heng, et al.
Publicado: (2026)
por: Jin, Heng, et al.
Publicado: (2026)
What You See Is What Matters: A Novel Visual and Physics-Based Metric for Evaluating Video Generation Quality
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
ViDscribe: Multimodal AI for Customizing Audio Description and Question Answering in Online Videos
por: Cheema, Maryam, et al.
Publicado: (2026)
por: Cheema, Maryam, et al.
Publicado: (2026)
Act to See, See to Act: Diffusion-Driven Perception-Action Interplay for Adaptive Policies
por: Wang, Jing, et al.
Publicado: (2025)
por: Wang, Jing, et al.
Publicado: (2025)
Describe Now: User-Driven Audio Description for Blind and Low Vision Individuals
por: Cheema, Maryam, et al.
Publicado: (2024)
por: Cheema, Maryam, et al.
Publicado: (2024)
ChartQA-X: Generating Explanations for Visual Chart Reasoning
por: Hegde, Shamanthak, et al.
Publicado: (2025)
por: Hegde, Shamanthak, et al.
Publicado: (2025)
DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis
por: Li, Yinghao Aaron, et al.
Publicado: (2025)
por: Li, Yinghao Aaron, et al.
Publicado: (2025)
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
por: Yang, Jihan, et al.
Publicado: (2024)
por: Yang, Jihan, et al.
Publicado: (2024)
Sensing Absence: How to See What Isn't There in the Study of Science and Security
por: Rappert, Brian
Publicado: (2024)
por: Rappert, Brian
Publicado: (2024)
"See What I Imagine, Imagine What I See": Human-AI Co-Creation System for 360$^\circ$ Panoramic Video Generation in VR
por: Wen, Yunge
Publicado: (2025)
por: Wen, Yunge
Publicado: (2025)
SeeAction: Towards Reverse Engineering How-What-Where of HCI Actions from Screencasts for UI Automation
por: Zhao, Dehai, et al.
Publicado: (2025)
por: Zhao, Dehai, et al.
Publicado: (2025)
From Sora What We Can See: A Survey of Text-to-Video Generation
por: Sun, Rui, et al.
Publicado: (2024)
por: Sun, Rui, et al.
Publicado: (2024)
What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity
por: Li, Haoxi, et al.
Publicado: (2026)
por: Li, Haoxi, et al.
Publicado: (2026)
Do You See What I See?: Observed Race and the Ascription of American Identity
por: Raul S. Casarez
Publicado: (2025)
por: Raul S. Casarez
Publicado: (2025)
What if Othello-Playing Language Models Could See?
por: Chen, Xinyi, et al.
Publicado: (2025)
por: Chen, Xinyi, et al.
Publicado: (2025)
Seeing What Matters: Empowering CLIP with Patch Generation-to-Selection
por: Pei, Gensheng, et al.
Publicado: (2025)
por: Pei, Gensheng, et al.
Publicado: (2025)
Do MLLMs See What We See? Analyzing Visualization Literacy Barriers in AI Systems
por: Mengli, et al.
Publicado: (2026)
por: Mengli, et al.
Publicado: (2026)
See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding
por: Sun, Boyuan, et al.
Publicado: (2026)
por: Sun, Boyuan, et al.
Publicado: (2026)
MediSee: Reasoning-based Pixel-level Perception in Medical Images
por: Tong, Qinyue, et al.
Publicado: (2025)
por: Tong, Qinyue, et al.
Publicado: (2025)
Towards Seeing Bones at Radio Frequency
por: Song, Yiwen, et al.
Publicado: (2025)
por: Song, Yiwen, et al.
Publicado: (2025)
Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
por: Ni, Ziqi, et al.
Publicado: (2025)
por: Ni, Ziqi, et al.
Publicado: (2025)
SeeClear: Semantic Distillation Enhances Pixel Condensation for Video Super-Resolution
por: Tang, Qi, et al.
Publicado: (2024)
por: Tang, Qi, et al.
Publicado: (2024)
Learning to See What You Need: Gaze Attention for Multimodal Large Language Models
por: Song, Junha, et al.
Publicado: (2026)
por: Song, Junha, et al.
Publicado: (2026)
Ejemplares similares
-
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video
por: Kulkarni, Yogesh, et al.
Publicado: (2025) -
ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
por: Li, Chaoyu, et al.
Publicado: (2025) -
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
por: Li, Chaoyu, et al.
Publicado: (2024) -
CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation
por: Li, Chaoyu, et al.
Publicado: (2026) -
VideoA11y: Method and Dataset for Accessible Video Description
por: Li, Chaoyu, et al.
Publicado: (2025)