Basis Vector Metric: A Method for Robust Open-Ended State Change Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Oprea, David, Powers, Sam |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
par: Demchak, Nathaniel, et autres
Publié: (2024)
par: Demchak, Nathaniel, et autres
Publié: (2024)
AutoLibra: Agent Metric Induction from Open-Ended Human Feedback
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
Reverse-Engineered Reasoning for Open-Ended Generation
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
Towards Open-Ended Discovery for Low-Resource NLP
par: Dossou, Bonaventure F. P., et autres
Publié: (2025)
par: Dossou, Bonaventure F. P., et autres
Publié: (2025)
Open-Ended Wargames with Large Language Models
par: Hogan, Daniel P., et autres
Publié: (2024)
par: Hogan, Daniel P., et autres
Publié: (2024)
Generating Planning Feedback for Open-Ended Programming Exercises with LLMs
par: Demirtaş, Mehmet Arif, et autres
Publié: (2025)
par: Demirtaş, Mehmet Arif, et autres
Publié: (2025)
Balancing Diversity and Risk in LLM Sampling: How to Select Your Method and Parameter for Open-Ended Text Generation
par: Zhou, Yuxuan, et autres
Publié: (2024)
par: Zhou, Yuxuan, et autres
Publié: (2024)
MIRROR: A Novel Approach for the Automated Evaluation of Open-Ended Question Generation
par: Deroy, Aniket, et autres
Publié: (2024)
par: Deroy, Aniket, et autres
Publié: (2024)
Generation Space Size: Understanding and Calibrating Open-Endedness of LLM Generations
par: Yu, Sunny, et autres
Publié: (2025)
par: Yu, Sunny, et autres
Publié: (2025)
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
par: Carlsson, Fredrik, et autres
Publié: (2024)
par: Carlsson, Fredrik, et autres
Publié: (2024)
O$^2$-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering
par: Mei, Jianbiao, et autres
Publié: (2025)
par: Mei, Jianbiao, et autres
Publié: (2025)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
par: Li, Yu, et autres
Publié: (2024)
par: Li, Yu, et autres
Publié: (2024)
Transparent Reference-free Automated Evaluation of Open-Ended User Survey Responses
par: An, Subin, et autres
Publié: (2025)
par: An, Subin, et autres
Publié: (2025)
GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models
par: Hutson, Dylan, et autres
Publié: (2025)
par: Hutson, Dylan, et autres
Publié: (2025)
Decoding Open-Ended Information Seeking Goals from Eye Movements in Reading
par: Hadar, Cfir Avraham, et autres
Publié: (2025)
par: Hadar, Cfir Avraham, et autres
Publié: (2025)
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
par: Li, Yishan, et autres
Publié: (2026)
par: Li, Yishan, et autres
Publié: (2026)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
par: Xie, Tianbao, et autres
Publié: (2024)
par: Xie, Tianbao, et autres
Publié: (2024)
R2-Write: Reflection and Revision for Open-Ended Writing with Deep Reasoning
par: Liu, Wanlong, et autres
Publié: (2026)
par: Liu, Wanlong, et autres
Publié: (2026)
AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses
par: Lu, Xiaotian, et autres
Publié: (2024)
par: Lu, Xiaotian, et autres
Publié: (2024)
ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation
par: Choi, Hyeong Kyu, et autres
Publié: (2026)
par: Choi, Hyeong Kyu, et autres
Publié: (2026)
StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs
par: Jeune, Pierre Le, et autres
Publié: (2026)
par: Jeune, Pierre Le, et autres
Publié: (2026)
The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
par: Lu, Chris, et autres
Publié: (2024)
par: Lu, Chris, et autres
Publié: (2024)
A Mixture-of-Experts Approach to Few-Shot Task Transfer in Open-Ended Text Worlds
par: Cui, Christopher Z., et autres
Publié: (2024)
par: Cui, Christopher Z., et autres
Publié: (2024)
In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models
par: Earle, Sam, et autres
Publié: (2026)
par: Earle, Sam, et autres
Publié: (2026)
Dreaming in Code for Curriculum Learning in Open-Ended Worlds
par: Mitsides, Konstantinos, et autres
Publié: (2026)
par: Mitsides, Konstantinos, et autres
Publié: (2026)
From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation
par: Guo, Zhihan, et autres
Publié: (2025)
par: Guo, Zhihan, et autres
Publié: (2025)
An Overview and Discussion on Using Large Language Models for Implementation Generation of Solutions to Open-Ended Problems
par: Shaik, Hashmath, et autres
Publié: (2024)
par: Shaik, Hashmath, et autres
Publié: (2024)
ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents
par: Shao, Jie-Jing, et autres
Publié: (2024)
par: Shao, Jie-Jing, et autres
Publié: (2024)
AEL: Agent Evolving Learning for Open-Ended Environments
par: Xu, Wujiang, et autres
Publié: (2026)
par: Xu, Wujiang, et autres
Publié: (2026)
Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences
par: Oprea, Simona-Vasilica, et autres
Publié: (2026)
par: Oprea, Simona-Vasilica, et autres
Publié: (2026)
DIVERGE: Diversity-Enhanced RAG for Open-Ended Information Seeking
par: Hu, Tianyi, et autres
Publié: (2026)
par: Hu, Tianyi, et autres
Publié: (2026)
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
par: Samvelyan, Mikayel, et autres
Publié: (2024)
par: Samvelyan, Mikayel, et autres
Publié: (2024)
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL
par: Yao, Yi, et autres
Publié: (2026)
par: Yao, Yi, et autres
Publié: (2026)
Do LLMs Exhibit Human-Like Reasoning? Evaluating Theory of Mind in LLMs for Open-Ended Responses
par: Amirizaniani, Maryam, et autres
Publié: (2024)
par: Amirizaniani, Maryam, et autres
Publié: (2024)
GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows
par: Wang, Jize, et autres
Publié: (2026)
par: Wang, Jize, et autres
Publié: (2026)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
par: Yang, Zixuan, et autres
Publié: (2026)
par: Yang, Zixuan, et autres
Publié: (2026)
From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset
par: Yoo, Haneul, et autres
Publié: (2026)
par: Yoo, Haneul, et autres
Publié: (2026)
A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering
par: Wang, Zhanliang, et autres
Publié: (2026)
par: Wang, Zhanliang, et autres
Publié: (2026)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
par: Li, Hengzhi, et autres
Publié: (2025)
par: Li, Hengzhi, et autres
Publié: (2025)
IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation
par: Tran, Khanh-Tung, et autres
Publié: (2025)
par: Tran, Khanh-Tung, et autres
Publié: (2025)
Documents similaires
-
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
par: Demchak, Nathaniel, et autres
Publié: (2024) -
AutoLibra: Agent Metric Induction from Open-Ended Human Feedback
par: Zhu, Hao, et autres
Publié: (2025) -
Reverse-Engineered Reasoning for Open-Ended Generation
par: Wang, Haozhe, et autres
Publié: (2025) -
Towards Open-Ended Discovery for Low-Resource NLP
par: Dossou, Bonaventure F. P., et autres
Publié: (2025) -
Open-Ended Wargames with Large Language Models
par: Hogan, Daniel P., et autres
Publié: (2024)