Enregistré dans:
| Auteurs principaux: | Kordi, Yeganeh, Nayak, Nihal V., Zuo, Max, Nguyen, Ilana, Bach, Stephen H. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.21692 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Does CLIP Bind Concepts? Probing Compositionality in Large Image Models
par: Lewis, Martha, et autres
Publié: (2022)
par: Lewis, Martha, et autres
Publié: (2022)
Preference Tuning For Toxicity Mitigation Generalizes Across Languages
par: Li, Xiaochen, et autres
Publié: (2024)
par: Li, Xiaochen, et autres
Publié: (2024)
Easy2Hard-Bench: Standardized Difficulty Labels for Profiling LLM Performance and Generalization
par: Ding, Mucong, et autres
Publié: (2024)
par: Ding, Mucong, et autres
Publié: (2024)
Tur[k]ingBench: A Challenge Benchmark for Web Agents
par: Xu, Kevin, et autres
Publié: (2024)
par: Xu, Kevin, et autres
Publié: (2024)
Planetarium: A Rigorous Benchmark for Translating Text to Structured Planning Languages
par: Zuo, Max, et autres
Publié: (2024)
par: Zuo, Max, et autres
Publié: (2024)
Learning to Generate Instruction Tuning Datasets for Zero-Shot Task Adaptation
par: Nayak, Nihal V., et autres
Publié: (2024)
par: Nayak, Nihal V., et autres
Publié: (2024)
Ace-CEFR -- A Dataset for Automated Evaluation of the Linguistic Difficulty of Conversational Texts for LLM Applications
par: Kogan, David, et autres
Publié: (2025)
par: Kogan, David, et autres
Publié: (2025)
CEval: A Benchmark for Evaluating Counterfactual Text Generation
par: Nguyen, Van Bach, et autres
Publié: (2024)
par: Nguyen, Van Bach, et autres
Publié: (2024)
ViSoLex: An Open-Source Repository for Vietnamese Social Media Lexical Normalization
par: Nguyen, Anh Thi-Hoang, et autres
Publié: (2025)
par: Nguyen, Anh Thi-Hoang, et autres
Publié: (2025)
LLMs for Generating and Evaluating Counterfactuals: A Comprehensive Study
par: Nguyen, Van Bach, et autres
Publié: (2024)
par: Nguyen, Van Bach, et autres
Publié: (2024)
LexC-Gen: Generating Data for Extremely Low-Resource Languages with Large Language Models and Bilingual Lexicons
par: Yong, Zheng-Xin, et autres
Publié: (2024)
par: Yong, Zheng-Xin, et autres
Publié: (2024)
Inclusive Easy-to-Read Generation for Individuals with Cognitive Impairments
par: Ledoyen, François, et autres
Publié: (2025)
par: Ledoyen, François, et autres
Publié: (2025)
EasyJudge: an Easy-to-use Tool for Comprehensive Response Evaluation of LLMs
par: Li, Yijie, et autres
Publié: (2024)
par: Li, Yijie, et autres
Publié: (2024)
Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
par: Pandit, Shrey, et autres
Publié: (2025)
par: Pandit, Shrey, et autres
Publié: (2025)
EasyECR: A Library for Easy Implementation and Evaluation of Event Coreference Resolution Models
par: Li, Yuncong, et autres
Publié: (2024)
par: Li, Yuncong, et autres
Publié: (2024)
Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View
par: Qi, Jianyu, et autres
Publié: (2025)
par: Qi, Jianyu, et autres
Publié: (2025)
From Black Boxes to Conversations: Incorporating XAI in a Conversational Agent
par: Nguyen, Van Bach, et autres
Publié: (2022)
par: Nguyen, Van Bach, et autres
Publié: (2022)
Anecdoctoring: Automated Red-Teaming Across Language and Place
par: Cuevas, Alejandro, et autres
Publié: (2025)
par: Cuevas, Alejandro, et autres
Publié: (2025)
Take It Easy: Label-Adaptive Self-Rationalization for Fact Verification and Explanation Generation
par: Yang, Jing, et autres
Publié: (2024)
par: Yang, Jing, et autres
Publié: (2024)
EasyRAG: Efficient Retrieval-Augmented Generation Framework for Automated Network Operations
par: Feng, Zhangchi, et autres
Publié: (2024)
par: Feng, Zhangchi, et autres
Publié: (2024)
From Model to Classroom: Evaluating Generated MCQs for Portuguese with Narrative and Difficulty Concerns
par: Leite, Bernardo, et autres
Publié: (2025)
par: Leite, Bernardo, et autres
Publié: (2025)
SoS: Analysis of Surface over Semantics in Multilingual Text-To-Image Generation
par: Holtermann, Carolin, et autres
Publié: (2026)
par: Holtermann, Carolin, et autres
Publié: (2026)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
par: Soligo, Anna, et autres
Publié: (2026)
par: Soligo, Anna, et autres
Publié: (2026)
Facilitating Cognitive Accessibility with LLMs: A Multi-Task Approach to Easy-to-Read Text Generation
par: Ledoyen, François, et autres
Publié: (2025)
par: Ledoyen, François, et autres
Publié: (2025)
Tackling the Inherent Difficulty of Noise Filtering in RAG
par: Liu, Jingyu, et autres
Publié: (2026)
par: Liu, Jingyu, et autres
Publié: (2026)
Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision
par: Sun, Zhiqing, et autres
Publié: (2024)
par: Sun, Zhiqing, et autres
Publié: (2024)
TD-EVAL: Revisiting Task-Oriented Dialogue Evaluation by Combining Turn-Level Precision with Dialogue-Level Comparisons
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
GRADE: Generating multi-hop QA and fine-gRAined Difficulty matrix for RAG Evaluation
par: Lee, Jeongsoo, et autres
Publié: (2025)
par: Lee, Jeongsoo, et autres
Publié: (2025)
Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models
par: Chan, Yik Siu, et autres
Publié: (2025)
par: Chan, Yik Siu, et autres
Publié: (2025)
Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty Prediction
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Frustratingly Easy Label Projection for Cross-lingual Transfer
par: Chen, Yang, et autres
Publié: (2022)
par: Chen, Yang, et autres
Publié: (2022)
On the Difficulty of Token-Level Modeling of Dysfluency and Fluency Shaping Artifacts
par: Gulzar, Kashaf, et autres
Publié: (2025)
par: Gulzar, Kashaf, et autres
Publié: (2025)
EasyGen: Easing Multimodal Generation with BiDiffuser and LLMs
par: Zhao, Xiangyu, et autres
Publié: (2023)
par: Zhao, Xiangyu, et autres
Publié: (2023)
Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning
par: Bae, Sanghwan, et autres
Publié: (2025)
par: Bae, Sanghwan, et autres
Publié: (2025)
Probing the Difficulty Perception Mechanism of Large Language Models
par: Lee, Sunbowen, et autres
Publié: (2025)
par: Lee, Sunbowen, et autres
Publié: (2025)
Question Difficulty Ranking for Multiple-Choice Reading Comprehension
par: Raina, Vatsal, et autres
Publié: (2024)
par: Raina, Vatsal, et autres
Publié: (2024)
A Shared Geometry of Difficulty in Multilingual Language Models
par: Civelli, Stefano, et autres
Publié: (2026)
par: Civelli, Stefano, et autres
Publié: (2026)
Difficulty Estimation and Simplification of French Text Using LLMs
par: Jamet, Henri, et autres
Publié: (2024)
par: Jamet, Henri, et autres
Publié: (2024)
Generating Multiple-Choice Knowledge Questions with Interpretable Difficulty Estimation using Knowledge Graphs and Large Language Models
par: Şakiroğlu, Mehmet Can, et autres
Publié: (2026)
par: Şakiroğlu, Mehmet Can, et autres
Publié: (2026)
Not-So-Strange Love: Language Models and Generative Linguistic Theories are More Compatible than They Appear
par: McCoy, R. Thomas
Publié: (2026)
par: McCoy, R. Thomas
Publié: (2026)
Documents similaires
-
Does CLIP Bind Concepts? Probing Compositionality in Large Image Models
par: Lewis, Martha, et autres
Publié: (2022) -
Preference Tuning For Toxicity Mitigation Generalizes Across Languages
par: Li, Xiaochen, et autres
Publié: (2024) -
Easy2Hard-Bench: Standardized Difficulty Labels for Profiling LLM Performance and Generalization
par: Ding, Mucong, et autres
Publié: (2024) -
Tur[k]ingBench: A Challenge Benchmark for Web Agents
par: Xu, Kevin, et autres
Publié: (2024) -
Planetarium: A Rigorous Benchmark for Translating Text to Structured Planning Languages
par: Zuo, Max, et autres
Publié: (2024)