DOLOMITES: Domain-Specific Long-Form Methodical Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Malaviya, Chaitanya, Agrawal, Priyanka, Ganchev, Kuzman, Srinivasan, Pranesh, Huot, Fantine, Berant, Jonathan, Yatskar, Mark, Das, Dipanjan, Lapata, Mirella, Alberti, Chris |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games
par: Eisenstein, Jacob, et autres
Publié: (2026)
par: Eisenstein, Jacob, et autres
Publié: (2026)
Evaluating LLMs for Targeted Concept Simplification for Domain-Specific Texts
par: Asthana, Sumit, et autres
Publié: (2024)
par: Asthana, Sumit, et autres
Publié: (2024)
$μ$PLAN: Summarizing using a Content Plan as Cross-Lingual Bridge
par: Huot, Fantine, et autres
Publié: (2023)
par: Huot, Fantine, et autres
Publié: (2023)
Learning Steerable Clarification Policies with Collaborative Self-play
par: Berant, Jonathan, et autres
Publié: (2025)
par: Berant, Jonathan, et autres
Publié: (2025)
Help Me Write a Story: Evaluating LLMs' Ability to Generate Writing Feedback
par: Rashkin, Hannah, et autres
Publié: (2025)
par: Rashkin, Hannah, et autres
Publié: (2025)
Don't lie to your friends: Learning what you know from collaborative self-play
par: Eisenstein, Jacob, et autres
Publié: (2025)
par: Eisenstein, Jacob, et autres
Publié: (2025)
Learning to Reason for Long-Form Story Generation
par: Gurung, Alexander, et autres
Publié: (2025)
par: Gurung, Alexander, et autres
Publié: (2025)
CHIRON: Rich Character Representations in Long-Form Narratives
par: Gurung, Alexander, et autres
Publié: (2024)
par: Gurung, Alexander, et autres
Publié: (2024)
Low-Rank Adaptation for Multilingual Summarization: An Empirical Study
par: Whitehouse, Chenxi, et autres
Publié: (2023)
par: Whitehouse, Chenxi, et autres
Publié: (2023)
What if you said that differently?: How Explanation Formats Affect Human Feedback Efficacy and User Perception
par: Malaviya, Chaitanya, et autres
Publié: (2023)
par: Malaviya, Chaitanya, et autres
Publié: (2023)
ResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and Rubrics
par: Yifei, Li S., et autres
Publié: (2025)
par: Yifei, Li S., et autres
Publié: (2025)
Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models
par: Bharadwaj, Anirudh, et autres
Publié: (2025)
par: Bharadwaj, Anirudh, et autres
Publié: (2025)
Agents' Room: Narrative Generation through Multi-step Collaboration
par: Huot, Fantine, et autres
Publié: (2024)
par: Huot, Fantine, et autres
Publié: (2024)
AssistantBench: Can Web Agents Solve Realistic and Time-Consuming Tasks?
par: Yoran, Ori, et autres
Publié: (2024)
par: Yoran, Ori, et autres
Publié: (2024)
Learning to Plan and Generate Text with Citations
par: Fierro, Constanza, et autres
Publié: (2024)
par: Fierro, Constanza, et autres
Publié: (2024)
Long-Form Information Alignment Evaluation Beyond Atomic Facts
par: Zheng, Danna, et autres
Publié: (2025)
par: Zheng, Danna, et autres
Publié: (2025)
Context-Aware Hierarchical Merging for Long Document Summarization
par: Ou, Litu, et autres
Publié: (2025)
par: Ou, Litu, et autres
Publié: (2025)
ExpertQA: Expert-Curated Questions and Attributed Answers
par: Malaviya, Chaitanya, et autres
Publié: (2023)
par: Malaviya, Chaitanya, et autres
Publié: (2023)
Lightweight Latent Reasoning for Narrative Tasks
par: Gurung, Alexander, et autres
Publié: (2025)
par: Gurung, Alexander, et autres
Publié: (2025)
Contextualized Evaluations: Judging Language Model Responses to Underspecified Queries
par: Malaviya, Chaitanya, et autres
Publié: (2024)
par: Malaviya, Chaitanya, et autres
Publié: (2024)
Finding the Right Moment: Human-Assisted Trailer Creation via Task Composition
par: Papalampidi, Pinelopi, et autres
Publié: (2021)
par: Papalampidi, Pinelopi, et autres
Publié: (2021)
K*-Means: A Parameter-free Clustering Algorithm
par: Mahon, Louis, et autres
Publié: (2025)
par: Mahon, Louis, et autres
Publié: (2025)
Multimodal Latent Reasoning via Predictive Embeddings
par: Adhikari, Ashutosh, et autres
Publié: (2026)
par: Adhikari, Ashutosh, et autres
Publié: (2026)
Reasoning about Intent for Ambiguous Requests
par: Saparina, Irina, et autres
Publié: (2025)
par: Saparina, Irina, et autres
Publié: (2025)
A Modular Approach for Multimodal Summarization of TV Shows
par: Mahon, Louis, et autres
Publié: (2024)
par: Mahon, Louis, et autres
Publié: (2024)
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
par: Mahon, Louis, et autres
Publié: (2024)
par: Mahon, Louis, et autres
Publié: (2024)
Debating for Better Reasoning: An Unsupervised Multimodal Approach
par: Adhikari, Ashutosh, et autres
Publié: (2025)
par: Adhikari, Ashutosh, et autres
Publié: (2025)
AMBROSIA: A Benchmark for Parsing Ambiguous Questions into Database Queries
par: Saparina, Irina, et autres
Publié: (2024)
par: Saparina, Irina, et autres
Publié: (2024)
Integrating Large Language Models with Graph-based Reasoning for Conversational Question Answering
par: Jain, Parag, et autres
Publié: (2024)
par: Jain, Parag, et autres
Publié: (2024)
Disambiguate First, Parse Later: Generating Interpretations for Ambiguity Resolution in Semantic Parsing
par: Saparina, Irina, et autres
Publié: (2025)
par: Saparina, Irina, et autres
Publié: (2025)
Parameter-free Video Segmentation for Vision and Language Understanding
par: Mahon, Louis, et autres
Publié: (2025)
par: Mahon, Louis, et autres
Publié: (2025)
Improving Generalization in Semantic Parsing by Increasing Natural Language Variation
par: Saparina, Irina, et autres
Publié: (2024)
par: Saparina, Irina, et autres
Publié: (2024)
Retrieval-Pretrained Transformer: Long-range Language Modeling with Self-retrieval
par: Rubin, Ohad, et autres
Publié: (2023)
par: Rubin, Ohad, et autres
Publié: (2023)
Uncertainty Quantification in Retrieval Augmented Question Answering
par: Perez-Beltrachini, Laura, et autres
Publié: (2025)
par: Perez-Beltrachini, Laura, et autres
Publié: (2025)
Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
par: Li, Miao, et autres
Publié: (2026)
par: Li, Miao, et autres
Publié: (2026)
A Simple Joint Model for Improved Contextual Neural Lemmatization
par: Malaviya, Chaitanya, et autres
Publié: (2019)
par: Malaviya, Chaitanya, et autres
Publié: (2019)
Who Gets Cited Most? Benchmarking Long-Context Numerical Reasoning on Scientific Articles
par: Li, Miao, et autres
Publié: (2025)
par: Li, Miao, et autres
Publié: (2025)
PixT3: Pixel-based Table-To-Text Generation
par: Alonso, Iñigo, et autres
Publié: (2023)
par: Alonso, Iñigo, et autres
Publié: (2023)
Think Before you Write: QA-Guided Reasoning for Character Descriptions in Books
par: Papoudakis, Argyrios, et autres
Publié: (2026)
par: Papoudakis, Argyrios, et autres
Publié: (2026)
Generating Visual Stories with Grounded and Coreferent Characters
par: Liu, Danyang, et autres
Publié: (2024)
par: Liu, Danyang, et autres
Publié: (2024)
Documents similaires
-
MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games
par: Eisenstein, Jacob, et autres
Publié: (2026) -
Evaluating LLMs for Targeted Concept Simplification for Domain-Specific Texts
par: Asthana, Sumit, et autres
Publié: (2024) -
$μ$PLAN: Summarizing using a Content Plan as Cross-Lingual Bridge
par: Huot, Fantine, et autres
Publié: (2023) -
Learning Steerable Clarification Policies with Collaborative Self-play
par: Berant, Jonathan, et autres
Publié: (2025) -
Help Me Write a Story: Evaluating LLMs' Ability to Generate Writing Feedback
par: Rashkin, Hannah, et autres
Publié: (2025)