When AI Does Science: Evaluating the Autonomous AI Scientist KOSMOS in Radiation Biology
Fuente:
arXiv
Salvato in:
| Autori principali: | Nusrat, Humza, Nusrat, Omar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Autonomous Radiotherapy Treatment Planning Using DOLA: A Privacy-Preserving, LLM-Based Optimization Agent
di: Nusrat, Humza, et al.
Pubblicazione: (2025)
di: Nusrat, Humza, et al.
Pubblicazione: (2025)
Multi Class Depression Detection Through Tweets using Artificial Intelligence
di: Nusrat, Muhammad Osama, et al.
Pubblicazione: (2024)
di: Nusrat, Muhammad Osama, et al.
Pubblicazione: (2024)
The AI Data Scientist
di: Akimov, Farkhad, et al.
Pubblicazione: (2025)
di: Akimov, Farkhad, et al.
Pubblicazione: (2025)
From Complexity to Clarity: How AI Enhances Perceptions of Scientists and the Public's Understanding of Science
di: Markowitz, David M.
Pubblicazione: (2024)
di: Markowitz, David M.
Pubblicazione: (2024)
BARD10: A New Benchmark Reveals Significance of Bangla Stop-Words in Authorship Attribution
di: Moosa, Abdullah Muhammad, et al.
Pubblicazione: (2025)
di: Moosa, Abdullah Muhammad, et al.
Pubblicazione: (2025)
Token Trails: Navigating Contextual Depths in Conversational AI with ChatLLM
di: Kowsher, Md., et al.
Pubblicazione: (2024)
di: Kowsher, Md., et al.
Pubblicazione: (2024)
AiraXiv: An AI-Driven Open-Access Platform for Human and AI Scientists
di: Pan, Junshu, et al.
Pubblicazione: (2026)
di: Pan, Junshu, et al.
Pubblicazione: (2026)
AI Scientists Fail Without Strong Implementation Capability
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists
di: Yang, Junlin, et al.
Pubblicazione: (2026)
di: Yang, Junlin, et al.
Pubblicazione: (2026)
Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering
di: Sultana, Nusrat, et al.
Pubblicazione: (2026)
di: Sultana, Nusrat, et al.
Pubblicazione: (2026)
aiXiv: A Next-Generation Open Access Ecosystem for Scientific Discovery Generated by AI Scientists
di: Zhang, Pengsong, et al.
Pubblicazione: (2025)
di: Zhang, Pengsong, et al.
Pubblicazione: (2025)
The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
di: Lu, Chris, et al.
Pubblicazione: (2024)
di: Lu, Chris, et al.
Pubblicazione: (2024)
Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2025)
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2025)
Automated stereotactic radiosurgery planning using a human-in-the-loop reasoning large language model agent
di: Nusrat, Humza, et al.
Pubblicazione: (2025)
di: Nusrat, Humza, et al.
Pubblicazione: (2025)
When AI Navigates the Fog of War
di: Li, Ming, et al.
Pubblicazione: (2026)
di: Li, Ming, et al.
Pubblicazione: (2026)
AIvril: AI-Driven RTL Generation With Verification In-The-Loop
di: Islam, Mubashir ul, et al.
Pubblicazione: (2024)
di: Islam, Mubashir ul, et al.
Pubblicazione: (2024)
Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents
di: Testini, Irene, et al.
Pubblicazione: (2025)
di: Testini, Irene, et al.
Pubblicazione: (2025)
L-TUNING: Synchronized Label Tuning for Prompt and Prefix in LLMs
di: Kowsher, Md., et al.
Pubblicazione: (2023)
di: Kowsher, Md., et al.
Pubblicazione: (2023)
Advancing AI-Scientist Understanding: Multi-Agent LLMs with Interpretable Physics Reasoning
di: Xu, Yinggan, et al.
Pubblicazione: (2025)
di: Xu, Yinggan, et al.
Pubblicazione: (2025)
BloomNet: Exploring Single vs. Multiple Object Annotation for Flower Recognition Using YOLO Variants
di: Nusrat, Safwat, et al.
Pubblicazione: (2026)
di: Nusrat, Safwat, et al.
Pubblicazione: (2026)
When AI Speaks, Whose Values Does It Express? A Cross-Cultural Audit of Individualism-Collectivism Bias in Large Language Models
di: Venkata, Pruthvinath Jeripity
Pubblicazione: (2026)
di: Venkata, Pruthvinath Jeripity
Pubblicazione: (2026)
Are Large Language Models Reliable AI Scientists? Assessing Reverse-Engineering of Black-Box Systems
di: Geng, Jiayi, et al.
Pubblicazione: (2025)
di: Geng, Jiayi, et al.
Pubblicazione: (2025)
PaperBench: Evaluating AI's Ability to Replicate AI Research
di: Starace, Giulio, et al.
Pubblicazione: (2025)
di: Starace, Giulio, et al.
Pubblicazione: (2025)
C3AI: Crafting and Evaluating Constitutions for Constitutional AI
di: Kyrychenko, Yara, et al.
Pubblicazione: (2025)
di: Kyrychenko, Yara, et al.
Pubblicazione: (2025)
AutoPal: Autonomous Adaptation to Users for Personal AI Companionship
di: Cheng, Yi, et al.
Pubblicazione: (2024)
di: Cheng, Yi, et al.
Pubblicazione: (2024)
AI Does Not Alter Perceptions of Text Messages
di: Diamond, N'yoma
Pubblicazione: (2024)
di: Diamond, N'yoma
Pubblicazione: (2024)
On Psychology of AI -- Does Primacy Effect Affect ChatGPT and Other LLMs?
di: Hämäläinen, Mika
Pubblicazione: (2025)
di: Hämäläinen, Mika
Pubblicazione: (2025)
ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence
di: Meng, Rui, et al.
Pubblicazione: (2026)
di: Meng, Rui, et al.
Pubblicazione: (2026)
The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search
di: Yamada, Yutaro, et al.
Pubblicazione: (2025)
di: Yamada, Yutaro, et al.
Pubblicazione: (2025)
HalluCiteChecker: A Lightweight Toolkit for Hallucinated Citation Detection and Verification in the Era of AI Scientists
di: Sakai, Yusuke, et al.
Pubblicazione: (2026)
di: Sakai, Yusuke, et al.
Pubblicazione: (2026)
AI-Assisted Systematization for Evaluating GenAI Systems
di: Agarwal, Dhruv, et al.
Pubblicazione: (2026)
di: Agarwal, Dhruv, et al.
Pubblicazione: (2026)
AI Generated Text Detection
di: Alikhanov, Adilkhan, et al.
Pubblicazione: (2026)
di: Alikhanov, Adilkhan, et al.
Pubblicazione: (2026)
Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems
di: Zhang, Xing, et al.
Pubblicazione: (2026)
di: Zhang, Xing, et al.
Pubblicazione: (2026)
Holistic Evaluation and Failure Diagnosis of AI Agents
di: Madvil, Netta, et al.
Pubblicazione: (2026)
di: Madvil, Netta, et al.
Pubblicazione: (2026)
Does Socialization Emerge in AI Agent Society? A Case Study of Moltbook
di: Li, Ming, et al.
Pubblicazione: (2026)
di: Li, Ming, et al.
Pubblicazione: (2026)
Detecting Racist Text in Bengali: An Ensemble Deep Learning Framework
di: Saruar, S. S., et al.
Pubblicazione: (2024)
di: Saruar, S. S., et al.
Pubblicazione: (2024)
BEExAI: Benchmark to Evaluate Explainable AI
di: Sithakoul, Samuel, et al.
Pubblicazione: (2024)
di: Sithakoul, Samuel, et al.
Pubblicazione: (2024)
AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators
di: Mazumder, Aritra, et al.
Pubblicazione: (2026)
di: Mazumder, Aritra, et al.
Pubblicazione: (2026)
Detecting AI-Generated Text in Educational Content: Leveraging Machine Learning and Explainable AI for Academic Integrity
di: Najjar, Ayat A., et al.
Pubblicazione: (2025)
di: Najjar, Ayat A., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Autonomous Radiotherapy Treatment Planning Using DOLA: A Privacy-Preserving, LLM-Based Optimization Agent
di: Nusrat, Humza, et al.
Pubblicazione: (2025) -
Multi Class Depression Detection Through Tweets using Artificial Intelligence
di: Nusrat, Muhammad Osama, et al.
Pubblicazione: (2024) -
The AI Data Scientist
di: Akimov, Farkhad, et al.
Pubblicazione: (2025) -
From Complexity to Clarity: How AI Enhances Perceptions of Scientists and the Public's Understanding of Science
di: Markowitz, David M.
Pubblicazione: (2024) -
BARD10: A New Benchmark Reveals Significance of Bangla Stop-Words in Authorship Attribution
di: Moosa, Abdullah Muhammad, et al.
Pubblicazione: (2025)