Saved in:
| Main Authors: | Chen, Junhao, Huang, Yu, Li, Siyuan, Yao, Rui, Li, Hanqian, Zhang, Hanyu, Li, Jungang, Chen, Jian, Wang, Bowen, Hu, Xuming |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2509.21856 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VideoMark: A Distortion-Free Robust Watermarking Framework for Video Diffusion Models
by: Hu, Xuming, et al.
Published: (2025)
by: Hu, Xuming, et al.
Published: (2025)
Video Signature: Implicit Watermarking for Video Diffusion Models
by: Huang, Yu, et al.
Published: (2025)
by: Huang, Yu, et al.
Published: (2025)
A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model
by: Zheng, Qi, et al.
Published: (2026)
by: Zheng, Qi, et al.
Published: (2026)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
by: Pan, Yaning, et al.
Published: (2025)
by: Pan, Yaning, et al.
Published: (2025)
AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering
by: Zhang, Taolin, et al.
Published: (2026)
by: Zhang, Taolin, et al.
Published: (2026)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
by: Xun, Shuhang, et al.
Published: (2025)
by: Xun, Shuhang, et al.
Published: (2025)
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
by: Fan, Zhiting, et al.
Published: (2024)
by: Fan, Zhiting, et al.
Published: (2024)
A Benchmark for Long-Form Medical Question Answering
by: Hosseini, Pedram, et al.
Published: (2024)
by: Hosseini, Pedram, et al.
Published: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
by: Bai, Ge, et al.
Published: (2024)
by: Bai, Ge, et al.
Published: (2024)
HyperG: Hypergraph-Enhanced LLMs for Structured Knowledge
by: Huang, Sirui, et al.
Published: (2025)
by: Huang, Sirui, et al.
Published: (2025)
Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing
by: Mao, Qinghua, et al.
Published: (2026)
by: Mao, Qinghua, et al.
Published: (2026)
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
by: Wu, Xianjie, et al.
Published: (2024)
by: Wu, Xianjie, et al.
Published: (2024)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
by: Chen, Guo, et al.
Published: (2024)
by: Chen, Guo, et al.
Published: (2024)
A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering
by: Li, Yunxin, et al.
Published: (2023)
by: Li, Yunxin, et al.
Published: (2023)
Understanding Retrieval Augmentation for Long-Form Question Answering
by: Chen, Hung-Ting, et al.
Published: (2023)
by: Chen, Hung-Ting, et al.
Published: (2023)
ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
by: Luo, Sichun, et al.
Published: (2025)
by: Luo, Sichun, et al.
Published: (2025)
Open-Ended and Knowledge-Intensive Video Question Answering
by: Alam, Md Zarif Ul, et al.
Published: (2025)
by: Alam, Md Zarif Ul, et al.
Published: (2025)
Multimodal Reranking for Knowledge-Intensive Visual Question Answering
by: Wen, Haoyang, et al.
Published: (2024)
by: Wen, Haoyang, et al.
Published: (2024)
LongGenBench: Long-context Generation Benchmark
by: Liu, Xiang, et al.
Published: (2024)
by: Liu, Xiang, et al.
Published: (2024)
Atomic Consistency Preference Optimization for Long-Form Question Answering
by: Chen, Jingfeng, et al.
Published: (2025)
by: Chen, Jingfeng, et al.
Published: (2025)
Automatic Dataset Generation for Knowledge Intensive Question Answering Tasks
by: Yuen, Sizhe, et al.
Published: (2025)
by: Yuen, Sizhe, et al.
Published: (2025)
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
by: Pan, Wenbo, et al.
Published: (2025)
by: Pan, Wenbo, et al.
Published: (2025)
Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions
by: Tan, Cheng, et al.
Published: (2024)
by: Tan, Cheng, et al.
Published: (2024)
Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering
by: Müller, Philip, et al.
Published: (2026)
by: Müller, Philip, et al.
Published: (2026)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
by: Jiang, Zhuohang, et al.
Published: (2025)
by: Jiang, Zhuohang, et al.
Published: (2025)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
by: Tao, Sicheng, et al.
Published: (2025)
by: Tao, Sicheng, et al.
Published: (2025)
Review-Then-Refine: A Dynamic Framework for Multi-Hop Question Answering with Temporal Adaptability
by: Chen, Xiangsen, et al.
Published: (2024)
by: Chen, Xiangsen, et al.
Published: (2024)
MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
by: Zhang, Xinkai, et al.
Published: (2026)
by: Zhang, Xinkai, et al.
Published: (2026)
REAL: Resolving Knowledge Conflicts in Knowledge-Intensive Visual Question Answering via Reasoning-Pivot Alignment
by: Ye, Kai, et al.
Published: (2026)
by: Ye, Kai, et al.
Published: (2026)
Internal and External Knowledge Interactive Refinement Framework for Knowledge-Intensive Question Answering
by: Du, Haowei, et al.
Published: (2024)
by: Du, Haowei, et al.
Published: (2024)
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
by: He, Jianxiang, et al.
Published: (2025)
by: He, Jianxiang, et al.
Published: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
by: Choi, Changin, et al.
Published: (2025)
by: Choi, Changin, et al.
Published: (2025)
Long-Context Long-Form Question Answering for Legal Domain
by: Kulkarni, Anagha, et al.
Published: (2026)
by: Kulkarni, Anagha, et al.
Published: (2026)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
by: Kuan, Chun-Yi, et al.
Published: (2026)
by: Kuan, Chun-Yi, et al.
Published: (2026)
Select to Know: An Internal-External Knowledge Self-Selection Framework for Domain-Specific Question Answering
by: He, Bolei, et al.
Published: (2025)
by: He, Bolei, et al.
Published: (2025)
Narrative Aligned Long Form Video Question Answering
by: Jain, Rahul, et al.
Published: (2026)
by: Jain, Rahul, et al.
Published: (2026)
FinTextQA: A Dataset for Long-form Financial Question Answering
by: Chen, Jian, et al.
Published: (2024)
by: Chen, Jian, et al.
Published: (2024)
Jamendo-MT-QA: A Benchmark for Multi-Track Comparative Music Question Answering
by: Koh, Junyoung, et al.
Published: (2026)
by: Koh, Junyoung, et al.
Published: (2026)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
by: Li, Xiaoyuan, et al.
Published: (2025)
by: Li, Xiaoyuan, et al.
Published: (2025)
RooflineBench: A Benchmarking Framework for On-Device LLMs via Roofline Analysis
by: Bi, Zhen, et al.
Published: (2026)
by: Bi, Zhen, et al.
Published: (2026)
Similar Items
-
VideoMark: A Distortion-Free Robust Watermarking Framework for Video Diffusion Models
by: Hu, Xuming, et al.
Published: (2025) -
Video Signature: Implicit Watermarking for Video Diffusion Models
by: Huang, Yu, et al.
Published: (2025) -
A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model
by: Zheng, Qi, et al.
Published: (2026) -
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
by: Pan, Yaning, et al.
Published: (2025) -
AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering
by: Zhang, Taolin, et al.
Published: (2026)