SAW-Bench: Learning Situated Awareness in the Real World
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Chuhan, Han, Rilyn, Hsu, Joy, Liang, Yongyuan, Dhawan, Rajiv, Wu, Jiajun, Yang, Ming-Hsuan, Wang, Xin Eric |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From Programs to Poses: Factored Real-World Scene Generation via Learned Program Libraries
by: Hsu, Joy, et al.
Published: (2025)
by: Hsu, Joy, et al.
Published: (2025)
CueBench: Advancing Unified Understanding of Context-Aware Video Anomalies in Real-World
by: Yu, Yating, et al.
Published: (2025)
by: Yu, Yating, et al.
Published: (2025)
Predicate Hierarchies Improve Few-Shot State Classification
by: Jin, Emily, et al.
Published: (2025)
by: Jin, Emily, et al.
Published: (2025)
Dynamic Context-Aware Scene Reasoning Using Vision-Language Alignment in Zero-Shot Real-World Scenarios
by: Rajiv, Manjunath Prasad Holenarasipura, et al.
Published: (2025)
by: Rajiv, Manjunath Prasad Holenarasipura, et al.
Published: (2025)
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
by: Yang, Jihan, et al.
Published: (2024)
by: Yang, Jihan, et al.
Published: (2024)
STAR: A Benchmark for Situated Reasoning in Real-World Videos
by: Wu, Bo, et al.
Published: (2024)
by: Wu, Bo, et al.
Published: (2024)
Vision-Language Integration for Zero-Shot Scene Understanding in Real-World Environments
by: Rajiv, Manjunath Prasad Holenarasipura, et al.
Published: (2025)
by: Rajiv, Manjunath Prasad Holenarasipura, et al.
Published: (2025)
Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners
by: Feng, Chun, et al.
Published: (2024)
by: Feng, Chun, et al.
Published: (2024)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
by: Wang, Andong, et al.
Published: (2024)
by: Wang, Andong, et al.
Published: (2024)
A Tool Bottleneck Framework for Clinically-Informed and Interpretable Medical Image Understanding
by: Liu, Christina, et al.
Published: (2025)
by: Liu, Christina, et al.
Published: (2025)
Real-Time Assessment of Bystander Situation Awareness in Drone-Assisted First Aid
by: Chang, Shen, et al.
Published: (2025)
by: Chang, Shen, et al.
Published: (2025)
Learning Position-Aware Implicit Neural Network for Real-World Face Inpainting
by: Zhao, Bo, et al.
Published: (2024)
by: Zhao, Bo, et al.
Published: (2024)
FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning
by: Lyu, Weijie, et al.
Published: (2026)
by: Lyu, Weijie, et al.
Published: (2026)
What if? Emulative Simulation with World Models for Situated Reasoning
by: Liu, Ruiping, et al.
Published: (2026)
by: Liu, Ruiping, et al.
Published: (2026)
SmokeBench: A Real-World Dataset for Surveillance Image Desmoking in Early-Stage Fire Scenes
by: Jin, Wenzhuo, et al.
Published: (2025)
by: Jin, Wenzhuo, et al.
Published: (2025)
Single Document Image Highlight Removal via A Large-Scale Real-World Dataset and A Location-Aware Network
by: Pan, Lu, et al.
Published: (2025)
by: Pan, Lu, et al.
Published: (2025)
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
by: Li, Gengluo, et al.
Published: (2026)
by: Li, Gengluo, et al.
Published: (2026)
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
by: Chen, Jiacheng, et al.
Published: (2024)
by: Chen, Jiacheng, et al.
Published: (2024)
Distilling Spectral Graph for Object-Context Aware Open-Vocabulary Semantic Segmentation
by: Kim, Chanyoung, et al.
Published: (2024)
by: Kim, Chanyoung, et al.
Published: (2024)
Real-time Ship Recognition and Georeferencing for the Improvement of Maritime Situational Awareness
by: Perez, Borja Carrillo
Published: (2024)
by: Perez, Borja Carrillo
Published: (2024)
SciMDR: Advancing Scientific Multimodal Document Reasoning
by: Chen, Ziyu, et al.
Published: (2026)
by: Chen, Ziyu, et al.
Published: (2026)
SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution
by: Wu, Rongyuan, et al.
Published: (2023)
by: Wu, Rongyuan, et al.
Published: (2023)
KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models
by: Wu, Yongliang, et al.
Published: (2025)
by: Wu, Yongliang, et al.
Published: (2025)
Telling Left from Right: Identifying Geometry-Aware Semantic Correspondence
by: Zhang, Junyi, et al.
Published: (2023)
by: Zhang, Junyi, et al.
Published: (2023)
DeeDSR: Towards Real-World Image Super-Resolution via Degradation-Aware Stable Diffusion
by: Bi, Chunyang, et al.
Published: (2024)
by: Bi, Chunyang, et al.
Published: (2024)
Empowering Large Language Models with 3D Situation Awareness
by: Yuan, Zhihao, et al.
Published: (2025)
by: Yuan, Zhihao, et al.
Published: (2025)
Stanford-ORB: A Real-World 3D Object Inverse Rendering Benchmark
by: Kuang, Zhengfei, et al.
Published: (2023)
by: Kuang, Zhengfei, et al.
Published: (2023)
DACESR: Degradation-Aware Conditional Embedding for Real-World Image Super-Resolution
by: Lei, Xiaoyan, et al.
Published: (2026)
by: Lei, Xiaoyan, et al.
Published: (2026)
WeatherBench: A Real-World Benchmark Dataset for All-in-One Adverse Weather Image Restoration
by: Guan, Qiyuan, et al.
Published: (2025)
by: Guan, Qiyuan, et al.
Published: (2025)
DiffST: Spatiotemporal-Aware Diffusion for Real-World Space-Time Video Super-Resolution
by: Chen, Zheng, et al.
Published: (2026)
by: Chen, Zheng, et al.
Published: (2026)
Cascade Prompt Learning for Vision-Language Model Adaptation
by: Wu, Ge, et al.
Published: (2024)
by: Wu, Ge, et al.
Published: (2024)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
by: Wu, Hang, et al.
Published: (2026)
by: Wu, Hang, et al.
Published: (2026)
"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
by: Gu, Jing, et al.
Published: (2025)
by: Gu, Jing, et al.
Published: (2025)
SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation
by: Rapuri, Sampath, et al.
Published: (2026)
by: Rapuri, Sampath, et al.
Published: (2026)
UnsafeBench: Benchmarking Image Safety Classifiers on Real-World and AI-Generated Images
by: Qu, Yiting, et al.
Published: (2024)
by: Qu, Yiting, et al.
Published: (2024)
Degradation-Aware and Structure-Preserving Diffusion for Real-World Image Super-Resolution
by: Ji, Yang, et al.
Published: (2026)
by: Ji, Yang, et al.
Published: (2026)
VA-AR: Learning Velocity-Aware Action Representations with Mixture of Window Attention
by: Wei, Jiangning, et al.
Published: (2025)
by: Wei, Jiangning, et al.
Published: (2025)
Composable Part-Based Manipulation
by: Liu, Weiyu, et al.
Published: (2024)
by: Liu, Weiyu, et al.
Published: (2024)
TEXTS-Diff: TEXTS-Aware Diffusion Model for Real-World Text Image Super-Resolution
by: He, Haodong, et al.
Published: (2026)
by: He, Haodong, et al.
Published: (2026)
Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding
by: Liang, Yongyuan, et al.
Published: (2025)
by: Liang, Yongyuan, et al.
Published: (2025)
Similar Items
-
From Programs to Poses: Factored Real-World Scene Generation via Learned Program Libraries
by: Hsu, Joy, et al.
Published: (2025) -
CueBench: Advancing Unified Understanding of Context-Aware Video Anomalies in Real-World
by: Yu, Yating, et al.
Published: (2025) -
Predicate Hierarchies Improve Few-Shot State Classification
by: Jin, Emily, et al.
Published: (2025) -
Dynamic Context-Aware Scene Reasoning Using Vision-Language Alignment in Zero-Shot Real-World Scenarios
by: Rajiv, Manjunath Prasad Holenarasipura, et al.
Published: (2025) -
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
by: Yang, Jihan, et al.
Published: (2024)