Ensuring Reproducibility in Generative AI Systems for General Use Cases: A Framework for Regression Testing and Open Datasets
Fuente:
arXiv
Salvato in:
| Autori principali: | Morishige, Masumi, Koshihara, Ryo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding
di: Omasa, Takamitsu, et al.
Pubblicazione: (2025)
di: Omasa, Takamitsu, et al.
Pubblicazione: (2025)
Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions
di: Shiinoki, Shue, et al.
Pubblicazione: (2025)
di: Shiinoki, Shue, et al.
Pubblicazione: (2025)
Developing Story: Case Studies of Generative AI's Use in Journalism
di: Brigham, Natalie Grace, et al.
Pubblicazione: (2024)
di: Brigham, Natalie Grace, et al.
Pubblicazione: (2024)
Narrative Context Protocol: An Open-Source Storytelling Framework for Generative AI
di: Gerba, Hank
Pubblicazione: (2025)
di: Gerba, Hank
Pubblicazione: (2025)
aiXiv: A Next-Generation Open Access Ecosystem for Scientific Discovery Generated by AI Scientists
di: Zhang, Pengsong, et al.
Pubblicazione: (2025)
di: Zhang, Pengsong, et al.
Pubblicazione: (2025)
A General Retrieval-Augmented Generation Framework for Multimodal Case-Based Reasoning Applications
di: Marom, Ofir
Pubblicazione: (2025)
di: Marom, Ofir
Pubblicazione: (2025)
FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
di: Jin, Song, et al.
Pubblicazione: (2025)
di: Jin, Song, et al.
Pubblicazione: (2025)
ReviewEval: An Evaluation Framework for AI-Generated Reviews
di: Garg, Madhav Krishan, et al.
Pubblicazione: (2025)
di: Garg, Madhav Krishan, et al.
Pubblicazione: (2025)
Efficient Adaptive Transformer: An Empirical Study and Reproducible Framework
di: Miller, Jan
Pubblicazione: (2025)
di: Miller, Jan
Pubblicazione: (2025)
Development and Testing of Retrieval Augmented Generation in Large Language Models -- A Case Study Report
di: Ke, YuHe, et al.
Pubblicazione: (2024)
di: Ke, YuHe, et al.
Pubblicazione: (2024)
Lost-in-the-Middle in Long-Text Generation: Synthetic Dataset, Evaluation Framework, and Mitigation
di: Zhang, Junhao, et al.
Pubblicazione: (2025)
di: Zhang, Junhao, et al.
Pubblicazione: (2025)
Efficient Data Generation for Source-grounded Information-seeking Dialogs: A Use Case for Meeting Transcripts
di: Golany, Lotem, et al.
Pubblicazione: (2024)
di: Golany, Lotem, et al.
Pubblicazione: (2024)
Generative AI Act II: Test Time Scaling Drives Cognition Engineering
di: Xia, Shijie, et al.
Pubblicazione: (2025)
di: Xia, Shijie, et al.
Pubblicazione: (2025)
GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows
di: Wang, Jize, et al.
Pubblicazione: (2026)
di: Wang, Jize, et al.
Pubblicazione: (2026)
System Message Generation for User Preferences using Open-Source Models
di: Jeong, Minbyul, et al.
Pubblicazione: (2025)
di: Jeong, Minbyul, et al.
Pubblicazione: (2025)
An Agentic AI Framework for Training General Practitioner Student Skills
di: De Marez, Victor, et al.
Pubblicazione: (2025)
di: De Marez, Victor, et al.
Pubblicazione: (2025)
OpenAI GPT-5 System Card
di: Singh, Aaditya, et al.
Pubblicazione: (2025)
di: Singh, Aaditya, et al.
Pubblicazione: (2025)
Measuring Human Involvement in AI-Generated Text: A Case Study on Academic Writing
di: Guo, Yuchen, et al.
Pubblicazione: (2025)
di: Guo, Yuchen, et al.
Pubblicazione: (2025)
AI-Driven Generation of Old English: A Framework for Low-Resource Languages
di: Alva, Rodrigo Gabriel Salazar, et al.
Pubblicazione: (2025)
di: Alva, Rodrigo Gabriel Salazar, et al.
Pubblicazione: (2025)
Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
Exploring the Potential of Machine Translation for Generating Named Entity Datasets: A Case Study between Persian and English
di: Sartipi, Amir, et al.
Pubblicazione: (2023)
di: Sartipi, Amir, et al.
Pubblicazione: (2023)
SciQAG: A Framework for Auto-Generated Science Question Answering Dataset with Fine-grained Evaluation
di: Wan, Yuwei, et al.
Pubblicazione: (2024)
di: Wan, Yuwei, et al.
Pubblicazione: (2024)
Assessing AI-Generated Questions' Alignment with Cognitive Frameworks in Educational Assessment
di: Yaacoub, Antoun, et al.
Pubblicazione: (2025)
di: Yaacoub, Antoun, et al.
Pubblicazione: (2025)
Compiling Prompts, Not Crafting Them: A Reproducible Workflow for AI-Assisted Evidence Synthesis
di: Susnjak, Teo
Pubblicazione: (2025)
di: Susnjak, Teo
Pubblicazione: (2025)
A Comprehensive Review of Datasets for Clinical Mental Health AI Systems
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
Generative AI and Its Impact on Personalized Intelligent Tutoring Systems
di: Maity, Subhankar, et al.
Pubblicazione: (2024)
di: Maity, Subhankar, et al.
Pubblicazione: (2024)
LIMBA: An Open-Source Framework for the Preservation and Valorization of Low-Resource Languages using Generative Models
di: Carta, Salvatore Mario, et al.
Pubblicazione: (2024)
di: Carta, Salvatore Mario, et al.
Pubblicazione: (2024)
Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems
di: Cao, Yuhan, et al.
Pubblicazione: (2025)
di: Cao, Yuhan, et al.
Pubblicazione: (2025)
A Survey of Pun Generation: Datasets, Evaluations and Methodologies
di: Su, Yuchen, et al.
Pubblicazione: (2025)
di: Su, Yuchen, et al.
Pubblicazione: (2025)
FinGen: A Dataset for Argument Generation in Finance
di: Chen, Chung-Chi, et al.
Pubblicazione: (2024)
di: Chen, Chung-Chi, et al.
Pubblicazione: (2024)
PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System
di: Munoz, Gary D. Lopez, et al.
Pubblicazione: (2024)
di: Munoz, Gary D. Lopez, et al.
Pubblicazione: (2024)
REALM: A Dataset of Real-World LLM Use Cases
di: Cheng, Jingwen, et al.
Pubblicazione: (2025)
di: Cheng, Jingwen, et al.
Pubblicazione: (2025)
Generation Space Size: Understanding and Calibrating Open-Endedness of LLM Generations
di: Yu, Sunny, et al.
Pubblicazione: (2025)
di: Yu, Sunny, et al.
Pubblicazione: (2025)
Responsible AI for Test Equity and Quality: The Duolingo English Test as a Case Study
di: Burstein, Jill, et al.
Pubblicazione: (2024)
di: Burstein, Jill, et al.
Pubblicazione: (2024)
OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
Nine Ways to Break Copyright Law and Why Our LLM Won't: A Fair Use Aligned Generation Framework
di: Sharma, Aakash Sen, et al.
Pubblicazione: (2025)
di: Sharma, Aakash Sen, et al.
Pubblicazione: (2025)
Generative AI for FFRDCs
di: Maiya, Arun S.
Pubblicazione: (2025)
di: Maiya, Arun S.
Pubblicazione: (2025)
SAIF: A Comprehensive Framework for Evaluating the Risks of Generative AI in the Public Sector
di: Lee, Kyeongryul, et al.
Pubblicazione: (2025)
di: Lee, Kyeongryul, et al.
Pubblicazione: (2025)
Open TutorAI: An Open-source Platform for Personalized and Immersive Learning with Generative AI
di: Hajji, Mohamed El, et al.
Pubblicazione: (2026)
di: Hajji, Mohamed El, et al.
Pubblicazione: (2026)
Responsible AI in NLP: GUS-Net Span-Level Bias Detection Dataset and Benchmark for Generalizations, Unfairness, and Stereotypes
di: Powers, Maximus, et al.
Pubblicazione: (2024)
di: Powers, Maximus, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding
di: Omasa, Takamitsu, et al.
Pubblicazione: (2025) -
Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions
di: Shiinoki, Shue, et al.
Pubblicazione: (2025) -
Developing Story: Case Studies of Generative AI's Use in Journalism
di: Brigham, Natalie Grace, et al.
Pubblicazione: (2024) -
Narrative Context Protocol: An Open-Source Storytelling Framework for Generative AI
di: Gerba, Hank
Pubblicazione: (2025) -
aiXiv: A Next-Generation Open Access Ecosystem for Scientific Discovery Generated by AI Scientists
di: Zhang, Pengsong, et al.
Pubblicazione: (2025)