Evaluating Sakana's AI Scientist: Bold Claims, Mixed Results, and a Promising Future?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Beel, Joeran, Kan, Min-Yen, Baumgart, Moritz |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From AutoRecSys to AutoRecLab: A Call to Build, Evaluate, and Govern Autonomous Recommender-Systems Research Labs
par: Beel, Joeran, et autres
Publié: (2025)
par: Beel, Joeran, et autres
Publié: (2025)
e-Fold Cross-Validation for Recommender-System Evaluation
par: Baumgart, Moritz, et autres
Publié: (2024)
par: Baumgart, Moritz, et autres
Publié: (2024)
The Potential of AutoML for Recommender Systems
par: Vente, Tobias, et autres
Publié: (2024)
par: Vente, Tobias, et autres
Publié: (2024)
Green Recommender Systems: Optimizing Dataset Size for Energy-Efficient Algorithm Performance
par: Arabzadeh, Ardalan, et autres
Publié: (2024)
par: Arabzadeh, Ardalan, et autres
Publié: (2024)
Ensembles at Any Cost? Accuracy-Energy Trade-offs in Recommender Systems
par: Nitschke, Jannik, et autres
Publié: (2026)
par: Nitschke, Jannik, et autres
Publié: (2026)
Algorithm Selection for Recommender Systems via Meta-Learning on Algorithm Characteristics
par: Decker, Jarne Mathi, et autres
Publié: (2025)
par: Decker, Jarne Mathi, et autres
Publié: (2025)
From Theory to Practice: Implementing and Evaluating e-Fold Cross-Validation
par: Mahlich, Christopher, et autres
Publié: (2024)
par: Mahlich, Christopher, et autres
Publié: (2024)
AIRwaves at CheckThat! 2025: Retrieving Scientific Sources for Implicit Claims on Social Media with Dual Encoders and Neural Re-Ranking
par: Ashbaugh, Cem, et autres
Publié: (2025)
par: Ashbaugh, Cem, et autres
Publié: (2025)
Recommender Systems Algorithm Selection for Ranking Prediction on Implicit Feedback Datasets
par: Wegmeth, Lukas, et autres
Publié: (2024)
par: Wegmeth, Lukas, et autres
Publié: (2024)
Green Recommender Systems: Understanding and Minimizing the Carbon Footprint of AI-Powered Personalization
par: Wegmeth, Lukas, et autres
Publié: (2025)
par: Wegmeth, Lukas, et autres
Publié: (2025)
Knowledge Graph Completion with Mixed Geometry Tensor Factorization
par: Yusupov, Viacheslav, et autres
Publié: (2025)
par: Yusupov, Viacheslav, et autres
Publié: (2025)
Navigating the Future of Federated Recommendation Systems with Foundation Models
par: Li, Zhiwei, et autres
Publié: (2024)
par: Li, Zhiwei, et autres
Publié: (2024)
Complementary Recommendation in E-commerce: Definition, Approaches, and Future Directions
par: Li, Linyue, et autres
Publié: (2024)
par: Li, Linyue, et autres
Publié: (2024)
Automated Justification Production for Claim Veracity in Fact Checking: A Survey on Architectures and Approaches
par: Eldifrawi, Islam, et autres
Publié: (2024)
par: Eldifrawi, Islam, et autres
Publié: (2024)
A Semi-Automated Solution Approach Recommender for a Given Use Case: a Case Study for AI/ML in Oncology via Scopus and OpenAI
par: Kılıç, Deniz Kenan, et autres
Publié: (2023)
par: Kılıç, Deniz Kenan, et autres
Publié: (2023)
Evaluating Podcast Recommendations with Profile-Aware LLM-as-a-Judge
par: Fabbri, Francesco, et autres
Publié: (2025)
par: Fabbri, Francesco, et autres
Publié: (2025)
Causal Predictive Optimization and Generation for Business AI
par: Zhao, Liyang, et autres
Publié: (2025)
par: Zhao, Liyang, et autres
Publié: (2025)
Smart E-commerce Recommendations with Semantic AI
par: Badouch, M., et autres
Publié: (2024)
par: Badouch, M., et autres
Publié: (2024)
Pitfalls in Evaluating Language Model Forecasters
par: Paleka, Daniel, et autres
Publié: (2025)
par: Paleka, Daniel, et autres
Publié: (2025)
A Comparative Evaluation of Quantification Methods
par: Schumacher, Tobias, et autres
Publié: (2021)
par: Schumacher, Tobias, et autres
Publié: (2021)
Evaluating the Robustness of Dense Retrievers in Interdisciplinary Domains
par: Chaturvedi, Sarthak, et autres
Publié: (2025)
par: Chaturvedi, Sarthak, et autres
Publié: (2025)
Coverage, Not Averages: Semantic Stratification for Trustworthy Retrieval Evaluation
par: Klearman, Andrew, et autres
Publié: (2026)
par: Klearman, Andrew, et autres
Publié: (2026)
A Comprehensive Survey of Evaluation Techniques for Recommendation Systems
par: Jadon, Aryan, et autres
Publié: (2023)
par: Jadon, Aryan, et autres
Publié: (2023)
Does It Look Sequential? An Analysis of Datasets for Evaluation of Sequential Recommendations
par: Klenitskiy, Anton, et autres
Publié: (2024)
par: Klenitskiy, Anton, et autres
Publié: (2024)
MultiMind at SemEval-2025 Task 7: Crosslingual Fact-Checked Claim Retrieval via Multi-Source Alignment
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
Explainable AI for Mental Disorder Detection via Social Media: A survey and outlook
par: Ibrahimov, Yusif, et autres
Publié: (2024)
par: Ibrahimov, Yusif, et autres
Publié: (2024)
AutoChemSchematic AI: Agentic Physics-Aware Automation for Chemical Manufacturing Scale-Up
par: Srinivas, Sakhinana Sagar, et autres
Publié: (2025)
par: Srinivas, Sakhinana Sagar, et autres
Publié: (2025)
A case study of Generative AI in MSX Sales Copilot: Improving seller productivity with a real-time question-answering system for content recommendation
par: Singh, Manpreet, et autres
Publié: (2024)
par: Singh, Manpreet, et autres
Publié: (2024)
Beyond KAN: Introducing KarSein for Adaptive High-Order Feature Interaction Modeling in CTR Prediction
par: Shi, Yunxiao, et autres
Publié: (2024)
par: Shi, Yunxiao, et autres
Publié: (2024)
From Clicks to Carbon: The Environmental Toll of Recommender Systems
par: Vente, Tobias, et autres
Publié: (2024)
par: Vente, Tobias, et autres
Publié: (2024)
EMERS: Energy Meter for Recommender Systems
par: Wegmeth, Lukas, et autres
Publié: (2024)
par: Wegmeth, Lukas, et autres
Publié: (2024)
PinLanding: Content-First Keyword Landing Page Generation via Multi-Modal AI for Web-Scale Discovery
par: Zhang, Faye, et autres
Publié: (2025)
par: Zhang, Faye, et autres
Publié: (2025)
HyPA-RAG: A Hybrid Parameter Adaptive Retrieval-Augmented Generation System for AI Legal and Policy Applications
par: Kalra, Rishi, et autres
Publié: (2024)
par: Kalra, Rishi, et autres
Publié: (2024)
RAGtifier: Evaluating RAG Generation Approaches of State-of-the-Art RAG Systems for the SIGIR LiveRAG Competition
par: Cofala, Tim, et autres
Publié: (2025)
par: Cofala, Tim, et autres
Publié: (2025)
MixLM: High-Throughput and Effective LLM Ranking via Text-Embedding Mix-Interaction
par: Li, Guoyao, et autres
Publié: (2025)
par: Li, Guoyao, et autres
Publié: (2025)
Entire Chain Uplift Modeling with Context-Enhanced Learning for Intelligent Marketing
par: Huang, Yinqiu, et autres
Publié: (2024)
par: Huang, Yinqiu, et autres
Publié: (2024)
Hgformer: Hyperbolic Graph Transformer for Recommendation
par: Yang, Xin, et autres
Publié: (2024)
par: Yang, Xin, et autres
Publié: (2024)
Semantic Retrieval at Walmart
par: Magnani, Alessandro, et autres
Publié: (2024)
par: Magnani, Alessandro, et autres
Publié: (2024)
InterFormer: Effective Heterogeneous Interaction Learning for Click-Through Rate Prediction
par: Zeng, Zhichen, et autres
Publié: (2024)
par: Zeng, Zhichen, et autres
Publié: (2024)
From Intent to AI Pipelines: A Controlled Agentic Framework for Non-AI Expert Scientists
par: Ali, Hyacinth, et autres
Publié: (2026)
par: Ali, Hyacinth, et autres
Publié: (2026)
Documents similaires
-
From AutoRecSys to AutoRecLab: A Call to Build, Evaluate, and Govern Autonomous Recommender-Systems Research Labs
par: Beel, Joeran, et autres
Publié: (2025) -
e-Fold Cross-Validation for Recommender-System Evaluation
par: Baumgart, Moritz, et autres
Publié: (2024) -
The Potential of AutoML for Recommender Systems
par: Vente, Tobias, et autres
Publié: (2024) -
Green Recommender Systems: Optimizing Dataset Size for Energy-Efficient Algorithm Performance
par: Arabzadeh, Ardalan, et autres
Publié: (2024) -
Ensembles at Any Cost? Accuracy-Energy Trade-offs in Recommender Systems
par: Nitschke, Jannik, et autres
Publié: (2026)