Aller au contenu
Universidad del Mar SIBUMAR Descubridor Institucional UMAR
  • Inicio
  • Búsqueda avanzada
  • Explorar
  • Connexion
    • English
    • Deutsch
    • Español
    • Français
    • Italiano
Recherche avancée
  • AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
Image de couverture de livre

AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Bragg, Jonathan, D'Arcy, Mike, Balepur, Nishant, Bareket, Dan, Dalvi, Bhavana, Feldman, Sergey, Haddad, Dany, Hwang, Jena D., Jansen, Peter, Kishore, Varsha, Majumder, Bodhisattwa Prasad, Naik, Aakanksha, Rahamimov, Sigal, Richardson, Kyle, Singh, Amanpreet, Surana, Harshit, Tiktinsky, Aryeh, Vasu, Rosni, Wiener, Guy, Anastasiades, Chloe, Candra, Stefan, Dunkelberger, Jason, Emery, Dan, Evans, Rob, Hamada, Malachi, Huff, Regan, Kinney, Rodney, Latzke, Matt, Lochner, Jaron, Lozano-Aguilera, Ruben, Nguyen, Cecile, Rao, Smita, Tanaka, Amber, Vlahos, Brooke, Clark, Peter, Downey, Doug, Goldberg, Yoav, Sabharwal, Ashish, Weld, Daniel S.
Format: Preprint
Publié: 2025
Sujets:
Artificial Intelligence
Computation and Language
Accès en ligne:
Acceder al recurso
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
  • Citer
  • Envoyer par SMS
  • Envoyer par courriel
  • Imprimer
  • Exporter les notices
    • Exporter vers RefWorks
    • Exporter vers EndNoteWeb
    • Exporter vers EndNote
  • Ajouter aux favoris
  • Permalien
  • Exemplaires
  • Description
  • Commentaires
  • Documents similaires
  • Affichage MARC
Description
Aucune description n'est disponible.

Documents similaires

  • Understanding Usage and Engagement in AI-Powered Scientific Research Tools: The Asta Interaction Dataset
    par: Haddad, Dany, et autres
    Publié: (2026)
  • Ai2 Scholar QA: Organized Literature Synthesis with Attribution
    par: Singh, Amanpreet, et autres
    Publié: (2025)
  • Deep Research, Shallow Evaluation: A Case Study in Meta-Evaluation for Long-Form QA Benchmarks
    par: Hwang, Jena D., et autres
    Publié: (2026)
  • Data-driven Discovery with Large Generative Models
    par: Majumder, Bodhisattwa Prasad, et autres
    Publié: (2024)
  • Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users
    par: Balepur, Nishant, et autres
    Publié: (2026)
Universidad del Mar
Universidad del MarSistema Bibliotecario de la Universidad del MarDescubridor Institucional UMARImplementación y desarrollo: Mtro. Carlos Alonso Albores Pérez
InicioBúsqueda avanzadaExplorar
Visitas al Descubridor: 33,245© 2026 Universidad del Mar