EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Cheng, Sijie, Guo, Zhicheng, Wu, Jingwen, Fang, Kechen, Li, Peng, Liu, Huaping, Liu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
di: Cheng, Sijie, et al.
Pubblicazione: (2024)
di: Cheng, Sijie, et al.
Pubblicazione: (2024)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
di: Jian, Pu, et al.
Pubblicazione: (2025)
di: Jian, Pu, et al.
Pubblicazione: (2025)
Re-Thinking Inverse Graphics With Large Language Models
di: Kulits, Peter, et al.
Pubblicazione: (2024)
di: Kulits, Peter, et al.
Pubblicazione: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
Chatting with Images for Introspective Visual Thinking
di: Wu, Junfei, et al.
Pubblicazione: (2026)
di: Wu, Junfei, et al.
Pubblicazione: (2026)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
di: Xiao, Wenyi, et al.
Pubblicazione: (2025)
di: Xiao, Wenyi, et al.
Pubblicazione: (2025)
Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context
di: Ruan, Kai, et al.
Pubblicazione: (2024)
di: Ruan, Kai, et al.
Pubblicazione: (2024)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
di: Qian, Kangan, et al.
Pubblicazione: (2025)
di: Qian, Kangan, et al.
Pubblicazione: (2025)
Mind's Mirror: Distilling Self-Evaluation Capability and Comprehensive Thinking from Large Language Models
di: Liu, Weize, et al.
Pubblicazione: (2023)
di: Liu, Weize, et al.
Pubblicazione: (2023)
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
di: Schäfer, Finn Rasmus, et al.
Pubblicazione: (2026)
di: Schäfer, Finn Rasmus, et al.
Pubblicazione: (2026)
Thinking with Generated Images
di: Chern, Ethan, et al.
Pubblicazione: (2025)
di: Chern, Ethan, et al.
Pubblicazione: (2025)
Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's Capabilities
di: Liu, Zhichen, et al.
Pubblicazione: (2026)
di: Liu, Zhichen, et al.
Pubblicazione: (2026)
VideoScore2: Think before You Score in Generative Video Evaluation
di: He, Xuan, et al.
Pubblicazione: (2025)
di: He, Xuan, et al.
Pubblicazione: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
di: Weng, Fenghua, et al.
Pubblicazione: (2025)
di: Weng, Fenghua, et al.
Pubblicazione: (2025)
Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
di: Sun, Kaiser, et al.
Pubblicazione: (2026)
di: Sun, Kaiser, et al.
Pubblicazione: (2026)
Weak-eval-Strong: Evaluating and Eliciting Lateral Thinking of LLMs with Situation Puzzles
di: Chen, Qi, et al.
Pubblicazione: (2024)
di: Chen, Qi, et al.
Pubblicazione: (2024)
When to Think and When to Look: Uncertainty-Guided Lookback
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
di: Tang, Liyan, et al.
Pubblicazione: (2025)
di: Tang, Liyan, et al.
Pubblicazione: (2025)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
di: Wu, Siwei, et al.
Pubblicazione: (2024)
di: Wu, Siwei, et al.
Pubblicazione: (2024)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
di: Wu, Xuyang, et al.
Pubblicazione: (2024)
di: Wu, Xuyang, et al.
Pubblicazione: (2024)
Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth
di: Chen, Mingrui, et al.
Pubblicazione: (2026)
di: Chen, Mingrui, et al.
Pubblicazione: (2026)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
GRIT: Teaching MLLMs to Think with Images
di: Fan, Yue, et al.
Pubblicazione: (2025)
di: Fan, Yue, et al.
Pubblicazione: (2025)
Evaluating Memory Capability in Continuous Lifelog Scenario
di: Zheng, Jianjie, et al.
Pubblicazione: (2026)
di: Zheng, Jianjie, et al.
Pubblicazione: (2026)
EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks
di: Liu, Lulin, et al.
Pubblicazione: (2026)
di: Liu, Lulin, et al.
Pubblicazione: (2026)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
di: Li, Sijie, et al.
Pubblicazione: (2026)
di: Li, Sijie, et al.
Pubblicazione: (2026)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
On the Thinking-Language Modeling Gap in Large Language Models
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
Thinking Before Speaking: A Role-playing Model with Mindset
di: Zhang, Baohua, et al.
Pubblicazione: (2024)
di: Zhang, Baohua, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
di: Cheng, Sijie, et al.
Pubblicazione: (2024) -
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
di: Pei, Baoqi, et al.
Pubblicazione: (2025) -
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
di: Guo, Zirun, et al.
Pubblicazione: (2025) -
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
di: Wu, Juncheng, et al.
Pubblicazione: (2026) -
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
di: Jian, Pu, et al.
Pubblicazione: (2025)