Act2See: Emergent Active Visual Perception for Video Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Martin Q., Qu, Yuxiao, Agrawal, Aditya, Guo, Willis, Liang, Paul Pu, Salakhutdinov, Ruslan, Morency, Louis-Philippe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
MultiIoT: Benchmarking Machine Learning for the Internet of Things
di: Mo, Shentong, et al.
Pubblicazione: (2023)
di: Mo, Shentong, et al.
Pubblicazione: (2023)
IoT-LM: Large Multisensory Language Models for the Internet of Things
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
MMoE: Enhancing Multimodal Models with Mixtures of Multimodal Interaction Experts
di: Yu, Haofei, et al.
Pubblicazione: (2023)
di: Yu, Haofei, et al.
Pubblicazione: (2023)
HEMM: Holistic Evaluation of Multimodal Foundation Models
di: Liang, Paul Pu, et al.
Pubblicazione: (2024)
di: Liang, Paul Pu, et al.
Pubblicazione: (2024)
Social Genome: Grounded Social Reasoning Abilities of Multimodal Models
di: Mathur, Leena, et al.
Pubblicazione: (2025)
di: Mathur, Leena, et al.
Pubblicazione: (2025)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
Advancing Social Intelligence in AI Agents: Technical Challenges and Open Questions
di: Mathur, Leena, et al.
Pubblicazione: (2024)
di: Mathur, Leena, et al.
Pubblicazione: (2024)
Multimodal Learning Without Labeled Multimodal Data: Guarantees and Applications
di: Liang, Paul Pu, et al.
Pubblicazione: (2023)
di: Liang, Paul Pu, et al.
Pubblicazione: (2023)
OpenFace 3.0: A Lightweight Multitask System for Comprehensive Facial Behavior Analysis
di: Hu, Jiewen, et al.
Pubblicazione: (2025)
di: Hu, Jiewen, et al.
Pubblicazione: (2025)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
Understanding Visual Concepts Across Models
di: Trabucco, Brandon, et al.
Pubblicazione: (2024)
di: Trabucco, Brandon, et al.
Pubblicazione: (2024)
Self-Correcting Decoding with Generative Feedback for Mitigating Hallucinations in Large Vision-Language Models
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
Act to See, See to Act: Diffusion-Driven Perception-Action Interplay for Adaptive Policies
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
See, Act, Adapt: Active Perception for Unsupervised Cross-Domain Visual Adaptation via Personalized VLM-Guided Agent
di: Tang, Tianci, et al.
Pubblicazione: (2026)
di: Tang, Tianci, et al.
Pubblicazione: (2026)
Propose, Solve, Verify: Self-Play Through Formal Verification
di: Wilf, Alex, et al.
Pubblicazione: (2025)
di: Wilf, Alex, et al.
Pubblicazione: (2025)
Can Large Reasoning Models Self-Train?
di: Shafayat, Sheikh, et al.
Pubblicazione: (2025)
di: Shafayat, Sheikh, et al.
Pubblicazione: (2025)
Tuning-free Visual Effect Transfer across Videos
di: Jones, Maxwell, et al.
Pubblicazione: (2026)
di: Jones, Maxwell, et al.
Pubblicazione: (2026)
Contrastive Difference Predictive Coding
di: Zheng, Chongyi, et al.
Pubblicazione: (2023)
di: Zheng, Chongyi, et al.
Pubblicazione: (2023)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
Optimizing Language Models for Human Preferences is a Causal Inference Problem
di: Lin, Victoria, et al.
Pubblicazione: (2024)
di: Lin, Victoria, et al.
Pubblicazione: (2024)
Isolated Causal Effects of Natural Language
di: Lin, Victoria, et al.
Pubblicazione: (2024)
di: Lin, Victoria, et al.
Pubblicazione: (2024)
Omitted Variable Bias in Language Models Under Distribution Shift
di: Lin, Victoria, et al.
Pubblicazione: (2026)
di: Lin, Victoria, et al.
Pubblicazione: (2026)
Emergent Active Perception and Dexterity of Simulated Humanoids from Visual Reinforcement Learning
di: Luo, Zhengyi, et al.
Pubblicazione: (2025)
di: Luo, Zhengyi, et al.
Pubblicazione: (2025)
Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs
di: Kanade, Aditya, et al.
Pubblicazione: (2025)
di: Kanade, Aditya, et al.
Pubblicazione: (2025)
ActMVS: Active Scene Reconstruction with Monocular Multi-View Stereo
di: Pu, Guo, et al.
Pubblicazione: (2026)
di: Pu, Guo, et al.
Pubblicazione: (2026)
Multi-Agent Computer Use
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
AV-Flow: Transforming Text to Audio-Visual Human-like Interactions
di: Chatziagapi, Aggelina, et al.
Pubblicazione: (2025)
di: Chatziagapi, Aggelina, et al.
Pubblicazione: (2025)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
di: Xie, Zequn, et al.
Pubblicazione: (2026)
di: Xie, Zequn, et al.
Pubblicazione: (2026)
VisualActBench: Can VLMs See and Act like a Human?
di: Zhang, Daoan, et al.
Pubblicazione: (2025)
di: Zhang, Daoan, et al.
Pubblicazione: (2025)
Social Caption: Evaluating Social Understanding in Multimodal Models
di: Thumu, Bhaavanaa, et al.
Pubblicazione: (2026)
di: Thumu, Bhaavanaa, et al.
Pubblicazione: (2026)
Inference via Interpolation: Contrastive Representations Provably Enable Planning and Inference
di: Eysenbach, Benjamin, et al.
Pubblicazione: (2024)
di: Eysenbach, Benjamin, et al.
Pubblicazione: (2024)
Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks
di: Dalal, Murtaza, et al.
Pubblicazione: (2024)
di: Dalal, Murtaza, et al.
Pubblicazione: (2024)
InSTA: Towards Internet-Scale Training For Agents
di: Trabucco, Brandon, et al.
Pubblicazione: (2025)
di: Trabucco, Brandon, et al.
Pubblicazione: (2025)
Effective Data Augmentation With Diffusion Models
di: Trabucco, Brandon, et al.
Pubblicazione: (2023)
di: Trabucco, Brandon, et al.
Pubblicazione: (2023)
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
di: Xiong, Yuqi, et al.
Pubblicazione: (2026)
di: Xiong, Yuqi, et al.
Pubblicazione: (2026)
LLAMADRS: Evaluating Open-Source LLMs on Real Clinical Interviews--To Reason or Not to Reason?
di: Kebe, Gaoussou Youssouf, et al.
Pubblicazione: (2025)
di: Kebe, Gaoussou Youssouf, et al.
Pubblicazione: (2025)
When Should AI Read the Room? Public Perceptions of Social Intelligence in AI Agents
di: Mathur, Leena, et al.
Pubblicazione: (2026)
di: Mathur, Leena, et al.
Pubblicazione: (2026)
From Reproduction to Replication: Evaluating Research Agents with Progressive Code Masking
di: Kim, Gyeongwon James, et al.
Pubblicazione: (2025)
di: Kim, Gyeongwon James, et al.
Pubblicazione: (2025)
Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning
di: Miao, Ziqi, et al.
Pubblicazione: (2026)
di: Miao, Ziqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
di: Ma, Martin Q., et al.
Pubblicazione: (2026) -
MultiIoT: Benchmarking Machine Learning for the Internet of Things
di: Mo, Shentong, et al.
Pubblicazione: (2023) -
IoT-LM: Large Multisensory Language Models for the Internet of Things
di: Mo, Shentong, et al.
Pubblicazione: (2024) -
MMoE: Enhancing Multimodal Models with Mixtures of Multimodal Interaction Experts
di: Yu, Haofei, et al.
Pubblicazione: (2023) -
HEMM: Holistic Evaluation of Multimodal Foundation Models
di: Liang, Paul Pu, et al.
Pubblicazione: (2024)