Salvato in:
| Autori principali: | Wang, Hexuan, Ren, Yaxuan, Bommireddypalli, Srikar, Chen, Shuxian, Prabhudesai, Adarsh, Zhou, Rongkun, Baral, Elina, Koehn, Philipp |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.08910 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CRAFT: Training-Free Cascaded Retrieval for Tabular QA
di: Singh, Adarsh, et al.
Pubblicazione: (2025)
di: Singh, Adarsh, et al.
Pubblicazione: (2025)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024)
di: Li, Chuhan, et al.
Pubblicazione: (2024)
SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
di: Baumgärtner, Tim, et al.
Pubblicazione: (2026)
di: Baumgärtner, Tim, et al.
Pubblicazione: (2026)
VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
di: Li, Yuyi, et al.
Pubblicazione: (2025)
di: Li, Yuyi, et al.
Pubblicazione: (2025)
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
di: Guo, Longteng, et al.
Pubblicazione: (2026)
di: Guo, Longteng, et al.
Pubblicazione: (2026)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
SciReasoner: Laying the Scientific Reasoning Ground Across Disciplines
di: Wang, Yizhou, et al.
Pubblicazione: (2025)
di: Wang, Yizhou, et al.
Pubblicazione: (2025)
Text Style Transfer with Parameter-efficient LLM Finetuning and Round-trip Translation
di: Liu, Ruoxi, et al.
Pubblicazione: (2026)
di: Liu, Ruoxi, et al.
Pubblicazione: (2026)
Speech Vecalign: an Embedding-based Method for Aligning Parallel Speech Documents
di: Meng, Chutong, et al.
Pubblicazione: (2025)
di: Meng, Chutong, et al.
Pubblicazione: (2025)
Learn and Unlearn: Addressing Misinformation in Multilingual LLMs
di: Lu, Taiming, et al.
Pubblicazione: (2024)
di: Lu, Taiming, et al.
Pubblicazione: (2024)
Geometry Matters: Benchmarking Scientific ML Approaches for Flow Prediction around Complex Geometries
di: Rabeh, Ali, et al.
Pubblicazione: (2024)
di: Rabeh, Ali, et al.
Pubblicazione: (2024)
SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence
di: Su, Encheng, et al.
Pubblicazione: (2026)
di: Su, Encheng, et al.
Pubblicazione: (2026)
MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
di: Arazi, Alan, et al.
Pubblicazione: (2026)
di: Arazi, Alan, et al.
Pubblicazione: (2026)
How Robust are the Tabular QA Models for Scientific Tables? A Study using Customized Dataset
di: Ghosh, Akash, et al.
Pubblicazione: (2024)
di: Ghosh, Akash, et al.
Pubblicazione: (2024)
SciMDR: Advancing Scientific Multimodal Document Reasoning
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
Metal-Sci: A Scientific Compute Benchmark for Evolutionary LLM Kernel Search on Apple Silicon
di: Gallego, Víctor
Pubblicazione: (2026)
di: Gallego, Víctor
Pubblicazione: (2026)
Quantifying Reproducibility Gaps in Publicly Available Plant Nuclear Bioimaging Datasets: The Reproducibility Risk Assessment Framework (RRAF)
di: Joardar, Sudipta, et al.
Pubblicazione: (2026)
di: Joardar, Sudipta, et al.
Pubblicazione: (2026)
Measuring Visual Understanding in Telecom domain: Performance Metrics for Image-to-UML conversion using VLMs
di: Ranjani, HG, et al.
Pubblicazione: (2025)
di: Ranjani, HG, et al.
Pubblicazione: (2025)
Dynamics of Dissociative Electron Attachment to Aliphatic Thiols
di: Das, Sukanta, et al.
Pubblicazione: (2023)
di: Das, Sukanta, et al.
Pubblicazione: (2023)
Breakthrough Asymmetries across Disciplines and Countries: A Network approach to Structural Complexity of Scientific Progress
di: Raghuvanshi, Adarsh, et al.
Pubblicazione: (2025)
di: Raghuvanshi, Adarsh, et al.
Pubblicazione: (2025)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
di: Wu, Siwei, et al.
Pubblicazione: (2024)
di: Wu, Siwei, et al.
Pubblicazione: (2024)
SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis
di: Cai, Hengxing, et al.
Pubblicazione: (2024)
di: Cai, Hengxing, et al.
Pubblicazione: (2024)
SciEvent: Benchmarking Multi-domain Scientific Event Extraction
di: Dong, Bofu, et al.
Pubblicazione: (2025)
di: Dong, Bofu, et al.
Pubblicazione: (2025)
SciAgent: Tool-augmented Language Models for Scientific Reasoning
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
WildSci: Advancing Scientific Reasoning from In-the-Wild Literature
di: Liu, Tengxiao, et al.
Pubblicazione: (2026)
di: Liu, Tengxiao, et al.
Pubblicazione: (2026)
Pointer-Generator Networks for Low-Resource Machine Translation: Don't Copy That!
di: Bafna, Niyati, et al.
Pubblicazione: (2024)
di: Bafna, Niyati, et al.
Pubblicazione: (2024)
Recovering document annotations for sentence-level bitext
di: Wicks, Rachel, et al.
Pubblicazione: (2024)
di: Wicks, Rachel, et al.
Pubblicazione: (2024)
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
di: Zou, Jiaru, et al.
Pubblicazione: (2025)
di: Zou, Jiaru, et al.
Pubblicazione: (2025)
Justinian und die Armee des frühen Byzanz
di: Koehn, Clemens
Pubblicazione: (2021)
di: Koehn, Clemens
Pubblicazione: (2021)
SciFIBench: Benchmarking Large Multimodal Models for Scientific Figure Interpretation
di: Roberts, Jonathan, et al.
Pubblicazione: (2024)
di: Roberts, Jonathan, et al.
Pubblicazione: (2024)
SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning
di: Zheng, Tianshi, et al.
Pubblicazione: (2026)
di: Zheng, Tianshi, et al.
Pubblicazione: (2026)
PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR
di: Burgess, James, et al.
Pubblicazione: (2026)
di: Burgess, James, et al.
Pubblicazione: (2026)
Maximizing Confidence Alone Improves Reasoning
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2025)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2025)
Moneyball with LLMs: Analyzing Tabular Summarization in Sports Narratives
di: Upadhyay, Ritam, et al.
Pubblicazione: (2025)
di: Upadhyay, Ritam, et al.
Pubblicazione: (2025)
RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models
di: Satriani, Dario, et al.
Pubblicazione: (2025)
di: Satriani, Dario, et al.
Pubblicazione: (2025)
GeoRC: A Benchmark for Geolocation Reasoning Chains
di: Talreja, Mohit, et al.
Pubblicazione: (2026)
di: Talreja, Mohit, et al.
Pubblicazione: (2026)
Online Ramsey numbers of the claw versus cycles
di: Zhi, Hexuan, et al.
Pubblicazione: (2026)
di: Zhi, Hexuan, et al.
Pubblicazione: (2026)
Three-color online Ramsey numbers $\tilde{r}(P_3,P_3,P_{\ell})$ and $\tilde{r}(P_3, P_3, C_{\ell})$
di: Zhi, Hexuan, et al.
Pubblicazione: (2025)
di: Zhi, Hexuan, et al.
Pubblicazione: (2025)
QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA
di: Dineen, Jacob, et al.
Pubblicazione: (2025)
di: Dineen, Jacob, et al.
Pubblicazione: (2025)
SciFigDetect: A Benchmark for AI-Generated Scientific Figure Detection
di: Hu, You, et al.
Pubblicazione: (2026)
di: Hu, You, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CRAFT: Training-Free Cascaded Retrieval for Tabular QA
di: Singh, Adarsh, et al.
Pubblicazione: (2025) -
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024) -
SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
di: Baumgärtner, Tim, et al.
Pubblicazione: (2026) -
VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
di: Li, Yuyi, et al.
Pubblicazione: (2025) -
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
di: Guo, Longteng, et al.
Pubblicazione: (2026)