WildSci: Advancing Scientific Reasoning from In-the-Wild Literature
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Tengxiao, Nathani, Deepak, Li, Zekun, Yang, Kevin, Wang, William Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AKEW: Assessing Knowledge Editing in the Wild
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
UltraIF: Advancing Instruction Following from the Wild
par: An, Kaikai, et autres
Publié: (2025)
par: An, Kaikai, et autres
Publié: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
par: Peng, Hao, et autres
Publié: (2026)
par: Peng, Hao, et autres
Publié: (2026)
SciMDR: Advancing Scientific Multimodal Document Reasoning
par: Chen, Ziyu, et autres
Publié: (2026)
par: Chen, Ziyu, et autres
Publié: (2026)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
par: Lu, Yujie, et autres
Publié: (2024)
par: Lu, Yujie, et autres
Publié: (2024)
WildIFEval: Instruction Following in the Wild
par: Lior, Gili, et autres
Publié: (2025)
par: Lior, Gili, et autres
Publié: (2025)
SciAgent: Tool-augmented Language Models for Scientific Reasoning
par: Ma, Yubo, et autres
Publié: (2024)
par: Ma, Yubo, et autres
Publié: (2024)
TextBind: Multi-turn Interleaved Multimodal Instruction-following in the Wild
par: Li, Huayang, et autres
Publié: (2023)
par: Li, Huayang, et autres
Publié: (2023)
Benchmarking LLM Tool-Use in the Wild
par: Yu, Peijie, et autres
Publié: (2026)
par: Yu, Peijie, et autres
Publié: (2026)
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
par: Lin, Bill Yuchen, et autres
Publié: (2024)
par: Lin, Bill Yuchen, et autres
Publié: (2024)
SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning
par: Zheng, Tianshi, et autres
Publié: (2026)
par: Zheng, Tianshi, et autres
Publié: (2026)
Evaluation Framework for AI Systems in "the Wild"
par: Jabbour, Sarah, et autres
Publié: (2025)
par: Jabbour, Sarah, et autres
Publié: (2025)
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
par: Arcuschin, Iván, et autres
Publié: (2025)
par: Arcuschin, Iván, et autres
Publié: (2025)
SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks
par: Zhao, Yilun, et autres
Publié: (2025)
par: Zhao, Yilun, et autres
Publié: (2025)
Accommodate Knowledge Conflicts in Retrieval-augmented LLMs: Towards Robust Response Generation in the Wild
par: Wang, Jiatai, et autres
Publié: (2025)
par: Wang, Jiatai, et autres
Publié: (2025)
Benchmarking Contextual and Paralinguistic Reasoning in Speech-LLMs: A Case Study with In-the-Wild Data
par: Wang, Qiongqiong, et autres
Publié: (2025)
par: Wang, Qiongqiong, et autres
Publié: (2025)
SciAgent: A Unified Multi-Agent System for Generalistic Scientific Reasoning
par: Li, Xuchen, et autres
Publié: (2025)
par: Li, Xuchen, et autres
Publié: (2025)
Continuous Knowledge Metabolism: Generating Scientific Hypotheses from Evolving Literature
par: Tao, Jinkai, et autres
Publié: (2026)
par: Tao, Jinkai, et autres
Publié: (2026)
SciNets: Graph-Constrained Multi-Hop Reasoning for Scientific Literature Synthesis
par: Dubey, Sauhard
Publié: (2025)
par: Dubey, Sauhard
Publié: (2025)
NLP Security and Ethics, in the Wild
par: Lent, Heather, et autres
Publié: (2025)
par: Lent, Heather, et autres
Publié: (2025)
CocoaBench: Evaluating Unified Digital Agents in the Wild
par: CocoaBench Team, et autres
Publié: (2026)
par: CocoaBench Team, et autres
Publié: (2026)
SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literature
par: Wadden, David, et autres
Publié: (2024)
par: Wadden, David, et autres
Publié: (2024)
Mapping Overlaps in Benchmarks through Perplexity in the Wild
par: Wu, Siyang, et autres
Publié: (2025)
par: Wu, Siyang, et autres
Publié: (2025)
RAG in the Wild: On the (In)effectiveness of LLMs with Mixture-of-Knowledge Retrieval Augmentation
par: Xu, Ran, et autres
Publié: (2025)
par: Xu, Ran, et autres
Publié: (2025)
ChartGemma: Visual Instruction-tuning for Chart Reasoning in the Wild
par: Masry, Ahmed, et autres
Publié: (2024)
par: Masry, Ahmed, et autres
Publié: (2024)
GIANTS: Generative Insight Anticipation from Scientific Literature
par: He-Yueya, Joy, et autres
Publié: (2026)
par: He-Yueya, Joy, et autres
Publié: (2026)
Exploring LLMs for Scientific Information Extraction Using The SciEx Framework
par: Li, Sha, et autres
Publié: (2025)
par: Li, Sha, et autres
Publié: (2025)
FlowPIE: Test-Time Scientific Idea Evolution with Flow-Guided Literature Exploration
par: Wang, Qiyao, et autres
Publié: (2026)
par: Wang, Qiyao, et autres
Publié: (2026)
Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild
par: Wang, Yumeng, et autres
Publié: (2025)
par: Wang, Yumeng, et autres
Publié: (2025)
Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks
par: Tan, Rongyuan, et autres
Publié: (2026)
par: Tan, Rongyuan, et autres
Publié: (2026)
On LLM-Based Scientific Inductive Reasoning Beyond Equations
par: Lin, Brian S., et autres
Publié: (2025)
par: Lin, Brian S., et autres
Publié: (2025)
SciDER: Scientific Data-centric End-to-end Researcher
par: Lin, Ke, et autres
Publié: (2026)
par: Lin, Ke, et autres
Publié: (2026)
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence
par: Wang, Yiheng, et autres
Publié: (2025)
par: Wang, Yiheng, et autres
Publié: (2025)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
par: Ding, Keyan, et autres
Publié: (2025)
par: Ding, Keyan, et autres
Publié: (2025)
Adopt $\neq$ Adapt: Longitudinal Analyses of LLM Conversations in the Wild
par: Hicke, Rebecca M. M., et autres
Publié: (2026)
par: Hicke, Rebecca M. M., et autres
Publié: (2026)
Teochew-Wild: The First In-the-wild Teochew Dataset with Orthographic Annotations
par: Pan, Linrong, et autres
Publié: (2025)
par: Pan, Linrong, et autres
Publié: (2025)
ProAgent: Harnessing On-Demand Sensory Contexts for Proactive LLM Agent Systems in the Wild
par: Yang, Bufang, et autres
Publié: (2025)
par: Yang, Bufang, et autres
Publié: (2025)
LoraRetriever: Input-Aware LoRA Retrieval and Composition for Mixed Tasks in the Wild
par: Zhao, Ziyu, et autres
Publié: (2024)
par: Zhao, Ziyu, et autres
Publié: (2024)
Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning
par: Yan, Yibo, et autres
Publié: (2025)
par: Yan, Yibo, et autres
Publié: (2025)
VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild
par: Inc, Xiaohongshu
Publié: (2026)
par: Inc, Xiaohongshu
Publié: (2026)
Documents similaires
-
AKEW: Assessing Knowledge Editing in the Wild
par: Wu, Xiaobao, et autres
Publié: (2024) -
UltraIF: Advancing Instruction Following from the Wild
par: An, Kaikai, et autres
Publié: (2025) -
WildReward: Learning Reward Models from In-the-Wild Human Interactions
par: Peng, Hao, et autres
Publié: (2026) -
SciMDR: Advancing Scientific Multimodal Document Reasoning
par: Chen, Ziyu, et autres
Publié: (2026) -
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
par: Lu, Yujie, et autres
Publié: (2024)