EAIRA: Establishing a Methodology for Evaluating AI Models as Scientific Research Assistants
Fuente:
arXiv
Salvato in:
| Autori principali: | Cappello, Franck, Madireddy, Sandeep, Underwood, Robert, Getty, Neil, Chia, Nicholas Lee-Ping, Ramachandra, Nesar, Nguyen, Josh, Keceli, Murat, Mallick, Tanwi, Li, Zilinghan, Ngom, Marieme, Zhang, Chenhui, Yanguas-Gil, Angel, Antoniuk, Evan, Kailkhura, Bhavya, Tian, Minyang, Du, Yufeng, Ting, Yuan-Sen, Wells, Azton, Nicolae, Bogdan, Maurya, Avinash, Rafique, M. Mustafa, Huerta, Eliu, Li, Bo, Foster, Ian, Stevens, Rick |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DataStates-LLM: Lazy Asynchronous Checkpointing for Large Language Models
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers
di: Maurya, Avinash, et al.
Pubblicazione: (2026)
di: Maurya, Avinash, et al.
Pubblicazione: (2026)
MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall
di: Maurya, Avinash, et al.
Pubblicazione: (2025)
di: Maurya, Avinash, et al.
Pubblicazione: (2025)
Deep Optimizer States: Towards Scalable Training of Transformer Models Using Interleaved Offloading
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
Breaking the Memory Wall: A Study of I/O Patterns and GPU Memory Utilization for Hybrid CPU-GPU Offloaded Optimizers
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
Kernel Model Validation: How To Do It, And Why You Should Care
di: Graziani, Carlo, et al.
Pubblicazione: (2025)
di: Graziani, Carlo, et al.
Pubblicazione: (2025)
Targeted Adaptive Design
di: Graziani, Carlo, et al.
Pubblicazione: (2022)
di: Graziani, Carlo, et al.
Pubblicazione: (2022)
Teaching LLMs to Speak Spectroscopy
di: Ramachandra, Nesar, et al.
Pubblicazione: (2025)
di: Ramachandra, Nesar, et al.
Pubblicazione: (2025)
Multi-modal Foundation Model for Cosmological Simulation Data
di: Xia, Bin, et al.
Pubblicazione: (2025)
di: Xia, Bin, et al.
Pubblicazione: (2025)
Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models
di: Gokdemir, Ozan, et al.
Pubblicazione: (2025)
di: Gokdemir, Ozan, et al.
Pubblicazione: (2025)
UProp: Investigating the Uncertainty Propagation of LLMs in Multi-Step Agentic Decision-Making
di: Duan, Jinhao, et al.
Pubblicazione: (2025)
di: Duan, Jinhao, et al.
Pubblicazione: (2025)
Extending $μ$P: Spectral Conditions for Feature Learning Across Optimizers
di: Gupta, Akshita, et al.
Pubblicazione: (2026)
di: Gupta, Akshita, et al.
Pubblicazione: (2026)
Uncovering Physical Drivers of Dark Matter Halo Structures with Auxiliary-Variable-Guided Generative Models
di: Ganguli, Arkaprabha, et al.
Pubblicazione: (2026)
di: Ganguli, Arkaprabha, et al.
Pubblicazione: (2026)
AstroMLab 1: Who Wins Astronomy Jeopardy!?
di: Ting, Yuan-Sen, et al.
Pubblicazione: (2024)
di: Ting, Yuan-Sen, et al.
Pubblicazione: (2024)
Active Learning Enables Extrapolation in Molecular Generative Models
di: Antoniuk, Evan R., et al.
Pubblicazione: (2025)
di: Antoniuk, Evan R., et al.
Pubblicazione: (2025)
MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
di: Raghavan, Siddeshwar, et al.
Pubblicazione: (2025)
di: Raghavan, Siddeshwar, et al.
Pubblicazione: (2025)
Wavelet-Inspired Multiscale Graph Convolutional Recurrent Network for Traffic Forecasting
di: Qian, Qipeng, et al.
Pubblicazione: (2024)
di: Qian, Qipeng, et al.
Pubblicazione: (2024)
No Test Cases, No Problem: Distillation-Driven Code Generation for Scientific Workflows
di: Raghavan, Siddeshwar, et al.
Pubblicazione: (2026)
di: Raghavan, Siddeshwar, et al.
Pubblicazione: (2026)
Context Length Alone Hurts LLM Performance Despite Perfect Retrieval
di: Du, Yufeng, et al.
Pubblicazione: (2025)
di: Du, Yufeng, et al.
Pubblicazione: (2025)
From Atomistic Models to Machine Learning: Predictive Design of Nanocarbons under Extreme Conditions
di: Yan, Xiaoli, et al.
Pubblicazione: (2026)
di: Yan, Xiaoli, et al.
Pubblicazione: (2026)
Who Gets the Reward, Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents
di: Yang, Chih-Hsuan, et al.
Pubblicazione: (2025)
di: Yang, Chih-Hsuan, et al.
Pubblicazione: (2025)
Understanding Inference Scaling for LLMs: Bottlenecks, Trade-offs, and Performance Principles
di: Arif, Moiz, et al.
Pubblicazione: (2026)
di: Arif, Moiz, et al.
Pubblicazione: (2026)
BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models
di: Wang, Zhengyang, et al.
Pubblicazione: (2025)
di: Wang, Zhengyang, et al.
Pubblicazione: (2025)
Benchmarking AI-evolved cosmological structure formation
di: Dong, Xiaofeng, et al.
Pubblicazione: (2025)
di: Dong, Xiaofeng, et al.
Pubblicazione: (2025)
Enhancing Interpretability in Generative Modeling: Statistically Disentangled Latent Spaces Guided by Generative Factors in Scientific Datasets
di: Ganguli, Arkaprabha, et al.
Pubblicazione: (2025)
di: Ganguli, Arkaprabha, et al.
Pubblicazione: (2025)
LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals
di: Yeh, Samuel, et al.
Pubblicazione: (2025)
di: Yeh, Samuel, et al.
Pubblicazione: (2025)
AstroMLab 3: Achieving GPT-4o Level Performance in Astronomy with a Specialized 8B-Parameter Large Language Model
di: de Haan, Tijmen, et al.
Pubblicazione: (2024)
di: de Haan, Tijmen, et al.
Pubblicazione: (2024)
Reducing Model Error Using Optimised Galaxy Selection: Weak Lensing Cluster Mass Estimation
di: Rau, Markus Michael, et al.
Pubblicazione: (2024)
di: Rau, Markus Michael, et al.
Pubblicazione: (2024)
Toward Reliable, Safe, and Secure LLMs for Scientific Applications
di: Chaturvedi, Saket Sanjeev, et al.
Pubblicazione: (2026)
di: Chaturvedi, Saket Sanjeev, et al.
Pubblicazione: (2026)
Understanding LLM Checkpoint/Restore I/O Strategies and Patterns
di: Gossman, Mikaila J., et al.
Pubblicazione: (2025)
di: Gossman, Mikaila J., et al.
Pubblicazione: (2025)
FedSZ: Leveraging Error-Bounded Lossy Compression for Federated Learning Communications
di: Wilkins, Grant, et al.
Pubblicazione: (2023)
di: Wilkins, Grant, et al.
Pubblicazione: (2023)
AstroMLab 4: Benchmark-Topping Performance in Astronomy Q&A with a 70B-Parameter Domain-Specialized Reasoning Model
di: de Haan, Tijmen, et al.
Pubblicazione: (2025)
di: de Haan, Tijmen, et al.
Pubblicazione: (2025)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
FedCluster: Boosting the Convergence of Federated Learning via Cluster-Cycling
di: Chen, Cheng, et al.
Pubblicazione: (2020)
di: Chen, Cheng, et al.
Pubblicazione: (2020)
Improving Robustness In Sparse Autoencoders via Masked Regularization
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
Certifiably-Robust Federated Adversarial Learning via Randomized Smoothing
di: Chen, Cheng, et al.
Pubblicazione: (2021)
di: Chen, Cheng, et al.
Pubblicazione: (2021)
Training Dynamics of Transformers to Recognize Word Co-occurrence via Gradient Flow Analysis
di: Yang, Hongru, et al.
Pubblicazione: (2024)
di: Yang, Hongru, et al.
Pubblicazione: (2024)
End-to-End Mesh Optimization of a Hybrid Deep Learning Black-Box PDE Solver
di: Ma, Shaocong, et al.
Pubblicazione: (2024)
di: Ma, Shaocong, et al.
Pubblicazione: (2024)
Evaluating the Safety and Skill Reasoning of Large Reasoning Models Under Compute Constraints
di: Balaji, Adarsha, et al.
Pubblicazione: (2025)
di: Balaji, Adarsha, et al.
Pubblicazione: (2025)
Multi-task Modeling for Engineering Applications with Sparse Data
di: Comlek, Yigitcan, et al.
Pubblicazione: (2026)
di: Comlek, Yigitcan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DataStates-LLM: Lazy Asynchronous Checkpointing for Large Language Models
di: Maurya, Avinash, et al.
Pubblicazione: (2024) -
DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers
di: Maurya, Avinash, et al.
Pubblicazione: (2026) -
MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall
di: Maurya, Avinash, et al.
Pubblicazione: (2025) -
Deep Optimizer States: Towards Scalable Training of Transformer Models Using Interleaved Offloading
di: Maurya, Avinash, et al.
Pubblicazione: (2024) -
Breaking the Memory Wall: A Study of I/O Patterns and GPU Memory Utilization for Hybrid CPU-GPU Offloaded Optimizers
di: Maurya, Avinash, et al.
Pubblicazione: (2024)