DiNeR: a Large Realistic Dataset for Evaluating Compositional Generalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Chengang, Liu, Xiao, Feng, Yansong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Teaching Large Language Models an Unseen Language on the Fly
par: Zhang, Chen, et autres
Publié: (2024)
par: Zhang, Chen, et autres
Publié: (2024)
DiMA: An LLM-Powered Ride-Hailing Assistant at DiDi
par: Ning, Yansong, et autres
Publié: (2025)
par: Ning, Yansong, et autres
Publié: (2025)
Realistic Evaluation of Model Merging for Compositional Generalization
par: Tam, Derek, et autres
Publié: (2024)
par: Tam, Derek, et autres
Publié: (2024)
Haste Makes Waste: Evaluating Planning Abilities of LLMs for Efficient and Feasible Multitasking with Time Constraints Between Actions
par: Wu, Zirui, et autres
Publié: (2025)
par: Wu, Zirui, et autres
Publié: (2025)
CASA: Causality-driven Argument Sufficiency Assessment
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Automating Legal Interpretation with LLMs: Retrieval, Generation, and Evaluation
par: Luo, Kangcheng, et autres
Publié: (2025)
par: Luo, Kangcheng, et autres
Publié: (2025)
ELLA: Empowering LLMs for Interpretable, Accurate and Informative Legal Advice
par: Hu, Yutong, et autres
Publié: (2024)
par: Hu, Yutong, et autres
Publié: (2024)
Only One Relation Possible? Modeling the Ambiguity in Event Temporal Relation Extraction
par: Hu, Yutong, et autres
Publié: (2024)
par: Hu, Yutong, et autres
Publié: (2024)
Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?
par: Hu, Yutong, et autres
Publié: (2024)
par: Hu, Yutong, et autres
Publié: (2024)
ScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific Research
par: Lin, Junyong, et autres
Publié: (2025)
par: Lin, Junyong, et autres
Publié: (2025)
Realistic Evaluation of Toxicity in Large Language Models
par: Luong, Tinh Son, et autres
Publié: (2024)
par: Luong, Tinh Son, et autres
Publié: (2024)
Motion Generation from Fine-grained Textual Descriptions
par: Li, Kunhang, et autres
Publié: (2024)
par: Li, Kunhang, et autres
Publié: (2024)
ProTrix: Building Models for Planning and Reasoning over Tables with Sentence Context
par: Wu, Zirui, et autres
Publié: (2024)
par: Wu, Zirui, et autres
Publié: (2024)
RefTool: Reference-Guided Tool Creation for Knowledge-Intensive Reasoning
par: Liu, Xiao, et autres
Publié: (2025)
par: Liu, Xiao, et autres
Publié: (2025)
The Chronicles of RiDiC: Generating Datasets with Controlled Popularity Distribution for Long-form Factuality Evaluation
par: Braslavski, Pavel, et autres
Publié: (2026)
par: Braslavski, Pavel, et autres
Publié: (2026)
DiPaCo: Distributed Path Composition
par: Douillard, Arthur, et autres
Publié: (2024)
par: Douillard, Arthur, et autres
Publié: (2024)
Read it in Two Steps: Translating Extremely Low-Resource Languages with Code-Augmented Grammar Books
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
NeSyCoCo: A Neuro-Symbolic Concept Composer for Compositional Generalization
par: Kamali, Danial, et autres
Publié: (2024)
par: Kamali, Danial, et autres
Publié: (2024)
What Kinds of Tokens Benefit from Distant Text? An Analysis on Long Context Language Modeling
par: Hu, Yutong, et autres
Publié: (2024)
par: Hu, Yutong, et autres
Publié: (2024)
Automated Annotation of Evolving Corpora for Augmenting Longitudinal Network Data: A Framework Integrating Large Language Models and Expert Knowledge
par: Liu, Xiao, et autres
Publié: (2025)
par: Liu, Xiao, et autres
Publié: (2025)
Towards Realistic Few-Shot Relation Extraction: A New Meta Dataset and Evaluation
par: Alam, Fahmida, et autres
Publié: (2024)
par: Alam, Fahmida, et autres
Publié: (2024)
Enhancing Speech Large Language Models through Reinforced Behavior Alignment
par: Liu, Yansong, et autres
Publié: (2025)
par: Liu, Yansong, et autres
Publié: (2025)
Evaluating Morphological Compositional Generalization in Large Language Models
par: Ismayilzada, Mete, et autres
Publié: (2024)
par: Ismayilzada, Mete, et autres
Publié: (2024)
Chain of Condition: Construct, Verify and Solve Conditions for Conditional Question Answering
par: Lin, Jiuheng, et autres
Publié: (2024)
par: Lin, Jiuheng, et autres
Publié: (2024)
D$^2$Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning
par: Luo, Kangcheng, et autres
Publié: (2026)
par: Luo, Kangcheng, et autres
Publié: (2026)
Cross-Lingual Transfer of Cultural Knowledge: An Asymmetric Phenomenon
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models
par: Cao, Zouying, et autres
Publié: (2023)
par: Cao, Zouying, et autres
Publié: (2023)
Augmenting Research Ideation with Data: An Empirical Investigation in Social Science
par: Liu, Xiao, et autres
Publié: (2025)
par: Liu, Xiao, et autres
Publié: (2025)
WikiFactDiff: A Large, Realistic, and Temporally Adaptable Dataset for Atomic Factual Knowledge Update in Causal Language Models
par: Khodja, Hichem Ammar, et autres
Publié: (2024)
par: Khodja, Hichem Ammar, et autres
Publié: (2024)
DiLM: Distilling Dataset into Language Model for Text-level Dataset Distillation
par: Maekawa, Aru, et autres
Publié: (2024)
par: Maekawa, Aru, et autres
Publié: (2024)
EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation
par: Wang, Xinda, et autres
Publié: (2025)
par: Wang, Xinda, et autres
Publié: (2025)
JuniperLiu at CoMeDi Shared Task: Models as Annotators in Lexical Semantics Disagreements
par: Liu, Zhu, et autres
Publié: (2024)
par: Liu, Zhu, et autres
Publié: (2024)
Synthetic Dataset for Evaluating Complex Compositional Knowledge for Natural Language Inference
par: Akoju, Sushma Anand, et autres
Publié: (2023)
par: Akoju, Sushma Anand, et autres
Publié: (2023)
On Leakage of Code Generation Evaluation Datasets
par: Matton, Alexandre, et autres
Publié: (2024)
par: Matton, Alexandre, et autres
Publié: (2024)
Subject-level Inference for Realistic Text Anonymization Evaluation
par: Oh, Myeong Seok, et autres
Publié: (2026)
par: Oh, Myeong Seok, et autres
Publié: (2026)
Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator
par: Cao, Qian, et autres
Publié: (2025)
par: Cao, Qian, et autres
Publié: (2025)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
par: Yu, Linhao, et autres
Publié: (2024)
par: Yu, Linhao, et autres
Publié: (2024)
RECKON: Large-scale Reference-based Efficient Knowledge Evaluation for Large Language Model
par: Zhang, Lin, et autres
Publié: (2025)
par: Zhang, Lin, et autres
Publié: (2025)
Respond Beyond Language: A Benchmark for Video Generation in Response to Realistic User Intents
par: Wang, Shuting, et autres
Publié: (2025)
par: Wang, Shuting, et autres
Publié: (2025)
Privacy-Preserving Parameter-Efficient Fine-Tuning for Large Language Model Services
par: Li, Yansong, et autres
Publié: (2023)
par: Li, Yansong, et autres
Publié: (2023)
Documents similaires
-
Teaching Large Language Models an Unseen Language on the Fly
par: Zhang, Chen, et autres
Publié: (2024) -
DiMA: An LLM-Powered Ride-Hailing Assistant at DiDi
par: Ning, Yansong, et autres
Publié: (2025) -
Realistic Evaluation of Model Merging for Compositional Generalization
par: Tam, Derek, et autres
Publié: (2024) -
Haste Makes Waste: Evaluating Planning Abilities of LLMs for Efficient and Feasible Multitasking with Time Constraints Between Actions
par: Wu, Zirui, et autres
Publié: (2025) -
CASA: Causality-driven Argument Sufficiency Assessment
par: Liu, Xiao, et autres
Publié: (2024)