SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Zhiming, Xiao, Xiayang, Dong, Sihao, Wang, Peidong, Wang, HaiPeng, Pan, Qingyun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Accurate Risk Prediction Model for Surgical Site Infection After Lower Third Molar Surgery
di: HaiPeng Yu
Pubblicazione: (2024)
di: HaiPeng Yu
Pubblicazione: (2024)
OSAD: Open-Set Aircraft Detection in SAR Images
di: Xiao, Xiayang, et al.
Pubblicazione: (2024)
di: Xiao, Xiayang, et al.
Pubblicazione: (2024)
PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models
di: Wang, Yuwen, et al.
Pubblicazione: (2026)
di: Wang, Yuwen, et al.
Pubblicazione: (2026)
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
di: Wang, Pei, et al.
Pubblicazione: (2024)
di: Wang, Pei, et al.
Pubblicazione: (2024)
Language Models as Continuous Self-Evolving Data Engineers
di: Wang, Peidong, et al.
Pubblicazione: (2024)
di: Wang, Peidong, et al.
Pubblicazione: (2024)
TaskBench: Benchmarking Large Language Models for Task Automation
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
di: Wang, Shengkang, et al.
Pubblicazione: (2024)
di: Wang, Shengkang, et al.
Pubblicazione: (2024)
oMeBench: Towards Robust Benchmarking of LLMs in Organic Mechanism Elucidation and Reasoning
di: Xu, Ruiling, et al.
Pubblicazione: (2025)
di: Xu, Ruiling, et al.
Pubblicazione: (2025)
CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity
di: Wei, Xuefeng, et al.
Pubblicazione: (2026)
di: Wei, Xuefeng, et al.
Pubblicazione: (2026)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
di: Jia, Mengzhao, et al.
Pubblicazione: (2024)
di: Jia, Mengzhao, et al.
Pubblicazione: (2024)
SeedBench: A Multi-task Benchmark for Evaluating Large Language Models in Seed Science
di: Ying, Jie, et al.
Pubblicazione: (2025)
di: Ying, Jie, et al.
Pubblicazione: (2025)
MVISU-Bench: Benchmarking Mobile Agents for Real-World Tasks by Multi-App, Vague, Interactive, Single-App and Unethical Instructions
di: Huang, Zeyu, et al.
Pubblicazione: (2025)
di: Huang, Zeyu, et al.
Pubblicazione: (2025)
HI-TransPA: Hearing Impairments Translation Personal Assistant
di: Ma, Zhiming, et al.
Pubblicazione: (2025)
di: Ma, Zhiming, et al.
Pubblicazione: (2025)
PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry
di: Fouda, Aya E., et al.
Pubblicazione: (2025)
di: Fouda, Aya E., et al.
Pubblicazione: (2025)
CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders
di: Gulko, Alex, et al.
Pubblicazione: (2025)
di: Gulko, Alex, et al.
Pubblicazione: (2025)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
di: Gao, Junyuan, et al.
Pubblicazione: (2025)
di: Gao, Junyuan, et al.
Pubblicazione: (2025)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
di: Hu, He, et al.
Pubblicazione: (2025)
di: Hu, He, et al.
Pubblicazione: (2025)
Beyond Prompting: Efficient and Robust Contextual Biasing for Speech LLMs via Logit-Space Integration (LOGIC)
di: Wang, Peidong
Pubblicazione: (2026)
di: Wang, Peidong
Pubblicazione: (2026)
VL-RouterBench: A Benchmark for Vision-Language Model Routing
di: Huang, Zhehao, et al.
Pubblicazione: (2025)
di: Huang, Zhehao, et al.
Pubblicazione: (2025)
Vision-Language Interpreter for Robot Task Planning
di: Shirai, Keisuke, et al.
Pubblicazione: (2023)
di: Shirai, Keisuke, et al.
Pubblicazione: (2023)
CharacterBench: Benchmarking Character Customization of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2024)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2024)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
Struct-Bench: A Benchmark for Differentially Private Structured Text Generation
di: Wang, Shuaiqi, et al.
Pubblicazione: (2025)
di: Wang, Shuaiqi, et al.
Pubblicazione: (2025)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
di: Yang, Sihan, et al.
Pubblicazione: (2025)
di: Yang, Sihan, et al.
Pubblicazione: (2025)
BIOME-Bench: A Benchmark for Biomolecular Interaction Inference and Multi-Omics Pathway Mechanism Elucidation from Scientific Literature
di: Wei, Sibo, et al.
Pubblicazione: (2025)
di: Wei, Sibo, et al.
Pubblicazione: (2025)
TOD-ProcBench: Benchmarking Complex Instruction-Following in Task-Oriented Dialogues
di: Ghazarian, Sarik, et al.
Pubblicazione: (2025)
di: Ghazarian, Sarik, et al.
Pubblicazione: (2025)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
di: Zhang, Alexander, et al.
Pubblicazione: (2025)
di: Zhang, Alexander, et al.
Pubblicazione: (2025)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
di: Li, Youquan, et al.
Pubblicazione: (2024)
di: Li, Youquan, et al.
Pubblicazione: (2024)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks
di: He, Jiayi, et al.
Pubblicazione: (2024)
di: He, Jiayi, et al.
Pubblicazione: (2024)
BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems
di: Wang, Wei, et al.
Pubblicazione: (2024)
di: Wang, Wei, et al.
Pubblicazione: (2024)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
di: Xiao, Ruixuan, et al.
Pubblicazione: (2024)
di: Xiao, Ruixuan, et al.
Pubblicazione: (2024)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
di: Li, Bohan, et al.
Pubblicazione: (2025)
di: Li, Bohan, et al.
Pubblicazione: (2025)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
di: Jiang, Yuxin, et al.
Pubblicazione: (2023)
di: Jiang, Yuxin, et al.
Pubblicazione: (2023)
Seeing isn't Hearing: Benchmarking Vision Language Models at Interpreting Spectrograms
di: Loakman, Tyler, et al.
Pubblicazione: (2025)
di: Loakman, Tyler, et al.
Pubblicazione: (2025)
ProBench: Benchmarking Large Language Models in Competitive Programming
di: Yang, Lei, et al.
Pubblicazione: (2025)
di: Yang, Lei, et al.
Pubblicazione: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Accurate Risk Prediction Model for Surgical Site Infection After Lower Third Molar Surgery
di: HaiPeng Yu
Pubblicazione: (2024) -
OSAD: Open-Set Aircraft Detection in SAR Images
di: Xiao, Xiayang, et al.
Pubblicazione: (2024) -
PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models
di: Wang, Yuwen, et al.
Pubblicazione: (2026) -
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
di: Wang, Pei, et al.
Pubblicazione: (2024) -
Language Models as Continuous Self-Evolving Data Engineers
di: Wang, Peidong, et al.
Pubblicazione: (2024)