Exploring the use of AI authors and reviewers at Agents4Science
Fuente:
arXiv
Salvato in:
| Autori principali: | Bianchi, Federico, Queen, Owen, Thakkar, Nitya, Sun, Eric, Zou, James |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DSGym: A Holistic Framework for Evaluating and Training Data Science Agents
di: Nie, Fan, et al.
Pubblicazione: (2026)
di: Nie, Fan, et al.
Pubblicazione: (2026)
ReasonOps: Operator Segmentation for LLM Reasoning Traces
di: Lee, Daniel, et al.
Pubblicazione: (2026)
di: Lee, Daniel, et al.
Pubblicazione: (2026)
CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research
di: Queen, Owen, et al.
Pubblicazione: (2025)
di: Queen, Owen, et al.
Pubblicazione: (2025)
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
di: Bianchi, Federico, et al.
Pubblicazione: (2024)
di: Bianchi, Federico, et al.
Pubblicazione: (2024)
Can LLM feedback enhance review quality? A randomized study of 20K reviews at ICLR 2025
di: Thakkar, Nitya, et al.
Pubblicazione: (2025)
di: Thakkar, Nitya, et al.
Pubblicazione: (2025)
AI Agents That Matter
di: Kapoor, Sayash, et al.
Pubblicazione: (2024)
di: Kapoor, Sayash, et al.
Pubblicazione: (2024)
To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis
di: Bianchi, Federico, et al.
Pubblicazione: (2025)
di: Bianchi, Federico, et al.
Pubblicazione: (2025)
Personalized Recommendation Systems using Multimodal, Autonomous, Multi Agent Systems
di: Thakkar, Param, et al.
Pubblicazione: (2024)
di: Thakkar, Param, et al.
Pubblicazione: (2024)
Trustworthy AI in the Agentic Lakehouse: from Concurrency to Governance
di: Tagliabue, Jacopo, et al.
Pubblicazione: (2025)
di: Tagliabue, Jacopo, et al.
Pubblicazione: (2025)
"Sorry, I Didn't Catch That": How Speech Models Miss What Matters Most
di: Zhou, Kaitlyn, et al.
Pubblicazione: (2026)
di: Zhou, Kaitlyn, et al.
Pubblicazione: (2026)
ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning
di: Kwon, Yongchan, et al.
Pubblicazione: (2025)
di: Kwon, Yongchan, et al.
Pubblicazione: (2025)
Making Databases Faster with LLM Evolutionary Sampling
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2026)
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2026)
Agents for Experiments, Experiments for Agents: A Design Grammar for AI-Enabled Experimental Science
di: Zhang, Yingjie, et al.
Pubblicazione: (2026)
di: Zhang, Yingjie, et al.
Pubblicazione: (2026)
UniTS: A Unified Multi-Task Time Series Model
di: Gao, Shanghua, et al.
Pubblicazione: (2024)
di: Gao, Shanghua, et al.
Pubblicazione: (2024)
Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents
di: He, Muyu, et al.
Pubblicazione: (2025)
di: He, Muyu, et al.
Pubblicazione: (2025)
StorageXTuner: An LLM Agent-Driven Automatic Tuning Framework for Heterogeneous Storage Systems
di: Lin, Qi, et al.
Pubblicazione: (2025)
di: Lin, Qi, et al.
Pubblicazione: (2025)
Inefficiencies of Meta Agents for Agent Design
di: El, Batu, et al.
Pubblicazione: (2025)
di: El, Batu, et al.
Pubblicazione: (2025)
Introspection of Thought Helps AI Agents
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
From Sound to Sight: Towards AI-authored Music Videos
di: Vitasovic, Leo, et al.
Pubblicazione: (2025)
di: Vitasovic, Leo, et al.
Pubblicazione: (2025)
AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
di: Zeng, Zihang, et al.
Pubblicazione: (2026)
di: Zeng, Zihang, et al.
Pubblicazione: (2026)
AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents
di: Lupidi, Alisia, et al.
Pubblicazione: (2026)
di: Lupidi, Alisia, et al.
Pubblicazione: (2026)
Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents
di: Miao, Jiacheng, et al.
Pubblicazione: (2025)
di: Miao, Jiacheng, et al.
Pubblicazione: (2025)
Chain-of-Authorization: Embedding authorization into large language models
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
Science Across Languages: Assessing LLM Multilingual Translation of Scientific Papers
di: Kleidermacher, Hannah Calzi, et al.
Pubblicazione: (2025)
di: Kleidermacher, Hannah Calzi, et al.
Pubblicazione: (2025)
The AI Policy Module: Developing Computer Science Student Competency in AI Ethics and Policy
di: Weichert, James, et al.
Pubblicazione: (2025)
di: Weichert, James, et al.
Pubblicazione: (2025)
Regulating AI Adaptation: An Analysis of AI Medical Device Updates
di: Wu, Kevin, et al.
Pubblicazione: (2024)
di: Wu, Kevin, et al.
Pubblicazione: (2024)
Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation
di: Kapoor, Sayash, et al.
Pubblicazione: (2025)
di: Kapoor, Sayash, et al.
Pubblicazione: (2025)
Exploring the Impact of Explainable AI and Cognitive Capabilities on Users' Decisions
di: Cau, Federico Maria, et al.
Pubblicazione: (2025)
di: Cau, Federico Maria, et al.
Pubblicazione: (2025)
Domain Adaptable Prescriptive AI Agent for Enterprise
di: Orderique, Piero, et al.
Pubblicazione: (2024)
di: Orderique, Piero, et al.
Pubblicazione: (2024)
Cross Domain Evaluation of Multimodal Chain-of-Thought Reasoning of different datasets into the Amazon CoT Framework
di: Tiwari, Nitya, et al.
Pubblicazione: (2025)
di: Tiwari, Nitya, et al.
Pubblicazione: (2025)
Towards a Science of AI Agent Reliability
di: Rabanser, Stephan, et al.
Pubblicazione: (2026)
di: Rabanser, Stephan, et al.
Pubblicazione: (2026)
Deep Research of Deep Research: From Transformer to Agent, From AI to AI for Science
di: Yu, Yipeng
Pubblicazione: (2026)
di: Yu, Yipeng
Pubblicazione: (2026)
CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark
di: Siegel, Zachary S., et al.
Pubblicazione: (2024)
di: Siegel, Zachary S., et al.
Pubblicazione: (2024)
Voice "Cloning" is Style Transfer
di: Zhou, Kaitlyn, et al.
Pubblicazione: (2026)
di: Zhou, Kaitlyn, et al.
Pubblicazione: (2026)
LLM Agents as Social Scientists: A Human-AI Collaborative Platform for Social Science Automation
di: Wang, Lei, et al.
Pubblicazione: (2026)
di: Wang, Lei, et al.
Pubblicazione: (2026)
TextGrad: Automatic "Differentiation" via Text
di: Yuksekgonul, Mert, et al.
Pubblicazione: (2024)
di: Yuksekgonul, Mert, et al.
Pubblicazione: (2024)
The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents
di: Wang, Xinrun, et al.
Pubblicazione: (2026)
di: Wang, Xinrun, et al.
Pubblicazione: (2026)
KadiAssistant: A conversational AI Agent for information retrieval in Kadi4Mat
di: Cierpka, Adrian, et al.
Pubblicazione: (2026)
di: Cierpka, Adrian, et al.
Pubblicazione: (2026)
ClashEval: Quantifying the tug-of-war between an LLM's internal prior and external evidence
di: Wu, Kevin, et al.
Pubblicazione: (2024)
di: Wu, Kevin, et al.
Pubblicazione: (2024)
Explainable Machine Learning for Pediatric Dental Risk Stratification Using Socio-Demographic Determinants
di: Kanade, Manasi, et al.
Pubblicazione: (2026)
di: Kanade, Manasi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DSGym: A Holistic Framework for Evaluating and Training Data Science Agents
di: Nie, Fan, et al.
Pubblicazione: (2026) -
ReasonOps: Operator Segmentation for LLM Reasoning Traces
di: Lee, Daniel, et al.
Pubblicazione: (2026) -
CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research
di: Queen, Owen, et al.
Pubblicazione: (2025) -
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
di: Bianchi, Federico, et al.
Pubblicazione: (2024) -
Can LLM feedback enhance review quality? A randomized study of 20K reviews at ICLR 2025
di: Thakkar, Nitya, et al.
Pubblicazione: (2025)