Guardado en:
| Autores principales: | Oprea, David, Powers, Sam |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2509.07308 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
por: Demchak, Nathaniel, et al.
Publicado: (2024)
por: Demchak, Nathaniel, et al.
Publicado: (2024)
AutoLibra: Agent Metric Induction from Open-Ended Human Feedback
por: Zhu, Hao, et al.
Publicado: (2025)
por: Zhu, Hao, et al.
Publicado: (2025)
Reverse-Engineered Reasoning for Open-Ended Generation
por: Wang, Haozhe, et al.
Publicado: (2025)
por: Wang, Haozhe, et al.
Publicado: (2025)
Open-Ended Wargames with Large Language Models
por: Hogan, Daniel P., et al.
Publicado: (2024)
por: Hogan, Daniel P., et al.
Publicado: (2024)
Towards Open-Ended Discovery for Low-Resource NLP
por: Dossou, Bonaventure F. P., et al.
Publicado: (2025)
por: Dossou, Bonaventure F. P., et al.
Publicado: (2025)
Generating Planning Feedback for Open-Ended Programming Exercises with LLMs
por: Demirtaş, Mehmet Arif, et al.
Publicado: (2025)
por: Demirtaş, Mehmet Arif, et al.
Publicado: (2025)
Balancing Diversity and Risk in LLM Sampling: How to Select Your Method and Parameter for Open-Ended Text Generation
por: Zhou, Yuxuan, et al.
Publicado: (2024)
por: Zhou, Yuxuan, et al.
Publicado: (2024)
In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models
por: Earle, Sam, et al.
Publicado: (2026)
por: Earle, Sam, et al.
Publicado: (2026)
MIRROR: A Novel Approach for the Automated Evaluation of Open-Ended Question Generation
por: Deroy, Aniket, et al.
Publicado: (2024)
por: Deroy, Aniket, et al.
Publicado: (2024)
Generation Space Size: Understanding and Calibrating Open-Endedness of LLM Generations
por: Yu, Sunny, et al.
Publicado: (2025)
por: Yu, Sunny, et al.
Publicado: (2025)
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
por: Carlsson, Fredrik, et al.
Publicado: (2024)
por: Carlsson, Fredrik, et al.
Publicado: (2024)
The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
por: Lu, Chris, et al.
Publicado: (2024)
por: Lu, Chris, et al.
Publicado: (2024)
O$^2$-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering
por: Mei, Jianbiao, et al.
Publicado: (2025)
por: Mei, Jianbiao, et al.
Publicado: (2025)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
por: Li, Yu, et al.
Publicado: (2024)
por: Li, Yu, et al.
Publicado: (2024)
StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs
por: Jeune, Pierre Le, et al.
Publicado: (2026)
por: Jeune, Pierre Le, et al.
Publicado: (2026)
Dreaming in Code for Curriculum Learning in Open-Ended Worlds
por: Mitsides, Konstantinos, et al.
Publicado: (2026)
por: Mitsides, Konstantinos, et al.
Publicado: (2026)
Transparent Reference-free Automated Evaluation of Open-Ended User Survey Responses
por: An, Subin, et al.
Publicado: (2025)
por: An, Subin, et al.
Publicado: (2025)
GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models
por: Hutson, Dylan, et al.
Publicado: (2025)
por: Hutson, Dylan, et al.
Publicado: (2025)
Decoding Open-Ended Information Seeking Goals from Eye Movements in Reading
por: Hadar, Cfir Avraham, et al.
Publicado: (2025)
por: Hadar, Cfir Avraham, et al.
Publicado: (2025)
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
por: Li, Yishan, et al.
Publicado: (2026)
por: Li, Yishan, et al.
Publicado: (2026)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
por: Xie, Tianbao, et al.
Publicado: (2024)
por: Xie, Tianbao, et al.
Publicado: (2024)
R2-Write: Reflection and Revision for Open-Ended Writing with Deep Reasoning
por: Liu, Wanlong, et al.
Publicado: (2026)
por: Liu, Wanlong, et al.
Publicado: (2026)
AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses
por: Lu, Xiaotian, et al.
Publicado: (2024)
por: Lu, Xiaotian, et al.
Publicado: (2024)
ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation
por: Choi, Hyeong Kyu, et al.
Publicado: (2026)
por: Choi, Hyeong Kyu, et al.
Publicado: (2026)
Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences
por: Oprea, Simona-Vasilica, et al.
Publicado: (2026)
por: Oprea, Simona-Vasilica, et al.
Publicado: (2026)
A Mixture-of-Experts Approach to Few-Shot Task Transfer in Open-Ended Text Worlds
por: Cui, Christopher Z., et al.
Publicado: (2024)
por: Cui, Christopher Z., et al.
Publicado: (2024)
AEL: Agent Evolving Learning for Open-Ended Environments
por: Xu, Wujiang, et al.
Publicado: (2026)
por: Xu, Wujiang, et al.
Publicado: (2026)
DIVERGE: Diversity-Enhanced RAG for Open-Ended Information Seeking
por: Hu, Tianyi, et al.
Publicado: (2026)
por: Hu, Tianyi, et al.
Publicado: (2026)
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
por: Samvelyan, Mikayel, et al.
Publicado: (2024)
por: Samvelyan, Mikayel, et al.
Publicado: (2024)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
por: Li, Hengzhi, et al.
Publicado: (2025)
por: Li, Hengzhi, et al.
Publicado: (2025)
A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering
por: Wang, Zhanliang, et al.
Publicado: (2026)
por: Wang, Zhanliang, et al.
Publicado: (2026)
From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation
por: Guo, Zhihan, et al.
Publicado: (2025)
por: Guo, Zhihan, et al.
Publicado: (2025)
An Overview and Discussion on Using Large Language Models for Implementation Generation of Solutions to Open-Ended Problems
por: Shaik, Hashmath, et al.
Publicado: (2024)
por: Shaik, Hashmath, et al.
Publicado: (2024)
ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents
por: Shao, Jie-Jing, et al.
Publicado: (2024)
por: Shao, Jie-Jing, et al.
Publicado: (2024)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
por: Ye, Zhiling, et al.
Publicado: (2025)
por: Ye, Zhiling, et al.
Publicado: (2025)
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL
por: Yao, Yi, et al.
Publicado: (2026)
por: Yao, Yi, et al.
Publicado: (2026)
Do LLMs Exhibit Human-Like Reasoning? Evaluating Theory of Mind in LLMs for Open-Ended Responses
por: Amirizaniani, Maryam, et al.
Publicado: (2024)
por: Amirizaniani, Maryam, et al.
Publicado: (2024)
GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows
por: Wang, Jize, et al.
Publicado: (2026)
por: Wang, Jize, et al.
Publicado: (2026)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
por: Yang, Zixuan, et al.
Publicado: (2026)
por: Yang, Zixuan, et al.
Publicado: (2026)
From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset
por: Yoo, Haneul, et al.
Publicado: (2026)
por: Yoo, Haneul, et al.
Publicado: (2026)
Ejemplares similares
-
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
por: Demchak, Nathaniel, et al.
Publicado: (2024) -
AutoLibra: Agent Metric Induction from Open-Ended Human Feedback
por: Zhu, Hao, et al.
Publicado: (2025) -
Reverse-Engineered Reasoning for Open-Ended Generation
por: Wang, Haozhe, et al.
Publicado: (2025) -
Open-Ended Wargames with Large Language Models
por: Hogan, Daniel P., et al.
Publicado: (2024) -
Towards Open-Ended Discovery for Low-Resource NLP
por: Dossou, Bonaventure F. P., et al.
Publicado: (2025)