Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Di, Jiang, Liting, Fang, Ruiyu, Bianjing, Xie, Hongyan, Su, Haoxiang, Huang, Hao, He, Zhongjiang, Song, Shuangyong, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Dynamic Knowledge Fusion for Multi-Domain Dialogue State Tracking
by: Su, Haoxiang, et al.
Published: (2026)
by: Su, Haoxiang, et al.
Published: (2026)
Multi-Intent Spoken Language Understanding: Methods, Trends, and Challenges
by: Wu, Di, et al.
Published: (2025)
by: Wu, Di, et al.
Published: (2025)
Emotional Support with LLM-based Empathetic Dialogue Generation
by: Wang, Shiquan, et al.
Published: (2025)
by: Wang, Shiquan, et al.
Published: (2025)
A benchmark for joint dialogue satisfaction, emotion recognition, and emotion state transition prediction
by: Bian, Jing, et al.
Published: (2026)
by: Bian, Jing, et al.
Published: (2026)
MR-UIE: Multi-Perspective Reasoning with Reinforcement Learning for Universal Information Extraction
by: Li, Zhongqiu, et al.
Published: (2025)
by: Li, Zhongqiu, et al.
Published: (2025)
RB-SQL: A Retrieval-based LLM Framework for Text-to-SQL
by: Wu, Zhenhe, et al.
Published: (2024)
by: Wu, Zhenhe, et al.
Published: (2024)
Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models
by: Nie, Shuo, et al.
Published: (2026)
by: Nie, Shuo, et al.
Published: (2026)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
by: Chen, Hongjie, et al.
Published: (2025)
by: Chen, Hongjie, et al.
Published: (2025)
UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment
by: Xie, Hongyan, et al.
Published: (2026)
by: Xie, Hongyan, et al.
Published: (2026)
Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
by: Xie, Hongyan, et al.
Published: (2025)
by: Xie, Hongyan, et al.
Published: (2025)
TableReasoner: Advancing Table Reasoning Framework with Large Language Models
by: Xiong, Sishi, et al.
Published: (2025)
by: Xiong, Sishi, et al.
Published: (2025)
Towards Robustness and Diversity: Continual Learning in Dialog Generation with Text-Mixup and Batch Nuclear-Norm Maximization
by: Wang, Zihan, et al.
Published: (2024)
by: Wang, Zihan, et al.
Published: (2024)
VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
by: Zhan, Jun, et al.
Published: (2025)
by: Zhan, Jun, et al.
Published: (2025)
Sell More, Play Less: Benchmarking LLM Realistic Selling Skill
by: Su, Xuanbo, et al.
Published: (2026)
by: Su, Xuanbo, et al.
Published: (2026)
TableZoomer: A Collaborative Agent Framework for Large-scale Table Question Answering
by: Xiong, Sishi, et al.
Published: (2025)
by: Xiong, Sishi, et al.
Published: (2025)
Generate Realistic Test Scenes for V2X Communication Systems
by: Guo, An, et al.
Published: (2025)
by: Guo, An, et al.
Published: (2025)
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
by: Wang, Dingdong, et al.
Published: (2025)
by: Wang, Dingdong, et al.
Published: (2025)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
by: Cai, Dongnuan, et al.
Published: (2026)
by: Cai, Dongnuan, et al.
Published: (2026)
Table-R1: Region-based Reinforcement Learning for Table Understanding
by: Wu, Zhenhe, et al.
Published: (2025)
by: Wu, Zhenhe, et al.
Published: (2025)
ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios
by: Pan, Changzai, et al.
Published: (2026)
by: Pan, Changzai, et al.
Published: (2026)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
by: Gao, Tianyi, et al.
Published: (2025)
by: Gao, Tianyi, et al.
Published: (2025)
TCNN: Triple Convolutional Neural Network Models for Retrieval-based Question Answering System in E-commerce
by: Song, Shuangyong, et al.
Published: (2020)
by: Song, Shuangyong, et al.
Published: (2020)
Boosting Robust AIGI Detection with LoRA-based Pairwise Training
by: Xia, Ruiyang, et al.
Published: (2026)
by: Xia, Ruiyang, et al.
Published: (2026)
MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark
by: Peng, Yuezhang, et al.
Published: (2025)
by: Peng, Yuezhang, et al.
Published: (2025)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
by: Xu, Pengxin, et al.
Published: (2026)
by: Xu, Pengxin, et al.
Published: (2026)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
by: Jiang, Siyang, et al.
Published: (2025)
by: Jiang, Siyang, et al.
Published: (2025)
OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue
by: Geng, Xuelong, et al.
Published: (2025)
by: Geng, Xuelong, et al.
Published: (2025)
Open-Vocabulary Octree-Graph for 3D Scene Understanding
by: Wang, Zhigang, et al.
Published: (2024)
by: Wang, Zhigang, et al.
Published: (2024)
Spoken Language Identification with Pre-trained Models and Margin Loss
by: Fang, Zhihua, et al.
Published: (2026)
by: Fang, Zhihua, et al.
Published: (2026)
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
by: Liu, Jingwen, et al.
Published: (2025)
by: Liu, Jingwen, et al.
Published: (2025)
Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking
by: Khurdula, Harsha Vardhan, et al.
Published: (2024)
by: Khurdula, Harsha Vardhan, et al.
Published: (2024)
AFD-SLU: Adaptive Feature Distillation for Spoken Language Understanding
by: Xie, Yan, et al.
Published: (2025)
by: Xie, Yan, et al.
Published: (2025)
WavBench: Benchmarking Reasoning, Colloquialism, and Paralinguistics for End-to-End Spoken Dialogue Models
by: Li, Yangzhuo, et al.
Published: (2026)
by: Li, Yangzhuo, et al.
Published: (2026)
TELEVAL: A Dynamic Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios
by: Li, Zehan, et al.
Published: (2025)
by: Li, Zehan, et al.
Published: (2025)
Towards Realistic Open-Vocabulary Remote Sensing Segmentation: Benchmark and Baseline
by: Li, Bingyu, et al.
Published: (2026)
by: Li, Bingyu, et al.
Published: (2026)
METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark
by: Yang, Xu, et al.
Published: (2025)
by: Yang, Xu, et al.
Published: (2025)
SAGE: A Realistic Benchmark for Semantic Understanding
by: Goel, Samarth, et al.
Published: (2025)
by: Goel, Samarth, et al.
Published: (2025)
Comprehensive Anomaly Score Rank Based Unsupervised Sample Selection Method
by: Zhongjiang He, et al.
Published: (2025)
by: Zhongjiang He, et al.
Published: (2025)
Causal Reasoning Elicits Controllable 3D Scene Generation
by: Chen, Shen, et al.
Published: (2025)
by: Chen, Shen, et al.
Published: (2025)
BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval
by: Su, Hongjin, et al.
Published: (2024)
by: Su, Hongjin, et al.
Published: (2024)
Similar Items
-
Dynamic Knowledge Fusion for Multi-Domain Dialogue State Tracking
by: Su, Haoxiang, et al.
Published: (2026) -
Multi-Intent Spoken Language Understanding: Methods, Trends, and Challenges
by: Wu, Di, et al.
Published: (2025) -
Emotional Support with LLM-based Empathetic Dialogue Generation
by: Wang, Shiquan, et al.
Published: (2025) -
A benchmark for joint dialogue satisfaction, emotion recognition, and emotion state transition prediction
by: Bian, Jing, et al.
Published: (2026) -
MR-UIE: Multi-Perspective Reasoning with Reinforcement Learning for Universal Information Extraction
by: Li, Zhongqiu, et al.
Published: (2025)