Argument Collapse: LLMs Flatten Long-Form Public Debate
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Yekyung, Chang, Yapei, Pham, Chau Minh, Iyyer, Mohit |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLIPPER: Compression enables long-context synthetic data generation
par: Pham, Chau Minh, et autres
Publié: (2025)
par: Pham, Chau Minh, et autres
Publié: (2025)
BEARCUBS: A benchmark for computer-using web agents
par: Song, Yixiao, et autres
Publié: (2025)
par: Song, Yixiao, et autres
Publié: (2025)
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
par: Chang, Yapei, et autres
Publié: (2025)
par: Chang, Yapei, et autres
Publié: (2025)
FABLES: Evaluating faithfulness and content selection in book-length summarization
par: Kim, Yekyung, et autres
Publié: (2024)
par: Kim, Yekyung, et autres
Publié: (2024)
BooookScore: A systematic exploration of book-length summarization in the era of LLMs
par: Chang, Yapei, et autres
Publié: (2023)
par: Chang, Yapei, et autres
Publié: (2023)
Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs
par: Samuel, Vinay, et autres
Publié: (2026)
par: Samuel, Vinay, et autres
Publié: (2026)
VERISCORE: Evaluating the factuality of verifiable claims in long-form text generation
par: Song, Yixiao, et autres
Publié: (2024)
par: Song, Yixiao, et autres
Publié: (2024)
PostMark: A Robust Blackbox Watermark for Large Language Models
par: Chang, Yapei, et autres
Publié: (2024)
par: Chang, Yapei, et autres
Publié: (2024)
Suri: Multi-constraint Instruction Following for Long-form Text Generation
par: Pham, Chau Minh, et autres
Publié: (2024)
par: Pham, Chau Minh, et autres
Publié: (2024)
OWL: Probing Cross-Lingual Recall of Memorized Texts via World Literature
par: Srivastava, Alisha, et autres
Publié: (2025)
par: Srivastava, Alisha, et autres
Publié: (2025)
One ruler to measure them all: Benchmarking multilingual long-context language models
par: Kim, Yekyung, et autres
Publié: (2025)
par: Kim, Yekyung, et autres
Publié: (2025)
Frankentext: Stitching random text fragments into long-form narratives
par: Pham, Chau Minh, et autres
Publié: (2025)
par: Pham, Chau Minh, et autres
Publié: (2025)
People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated text
par: Russell, Jenna, et autres
Publié: (2025)
par: Russell, Jenna, et autres
Publié: (2025)
MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs
par: Ning, Yucheng, et autres
Publié: (2025)
par: Ning, Yucheng, et autres
Publié: (2025)
Whose story is it? Personalizing story generation by inferring author styles
par: Kumar, Nischal Ashok, et autres
Publié: (2025)
par: Kumar, Nischal Ashok, et autres
Publié: (2025)
Does quantization affect models' performance on long-context tasks?
par: Mekala, Anmol, et autres
Publié: (2025)
par: Mekala, Anmol, et autres
Publié: (2025)
One Thousand and One Pairs: A "novel" challenge for long-context language models
par: Karpinska, Marzena, et autres
Publié: (2024)
par: Karpinska, Marzena, et autres
Publié: (2024)
R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory
par: Li, Maoyuan, et autres
Publié: (2025)
par: Li, Maoyuan, et autres
Publié: (2025)
StoryScope: Investigating idiosyncrasies in AI fiction
par: Russell, Jenna, et autres
Publié: (2026)
par: Russell, Jenna, et autres
Publié: (2026)
TopicGPT: A Prompt-based Topic Modeling Framework
par: Pham, Chau Minh, et autres
Publié: (2023)
par: Pham, Chau Minh, et autres
Publié: (2023)
Beyond Precision: Importance-Aware Recall for Factuality Evaluation in Long-Form LLM Generation
par: Jafari, Nazanin, et autres
Publié: (2026)
par: Jafari, Nazanin, et autres
Publié: (2026)
Sanity Checks for Long-Form Hallucination Detection
par: Zollicoffer, Geigh, et autres
Publié: (2026)
par: Zollicoffer, Geigh, et autres
Publié: (2026)
Atomic Calibration of LLMs in Long-Form Generations
par: Zhang, Caiqi, et autres
Publié: (2024)
par: Zhang, Caiqi, et autres
Publié: (2024)
When Two LLMs Debate, Both Think They'll Win
par: Prasad, Pradyumna Shyama, et autres
Publié: (2025)
par: Prasad, Pradyumna Shyama, et autres
Publié: (2025)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
par: Choi, Nayoung, et autres
Publié: (2026)
par: Choi, Nayoung, et autres
Publié: (2026)
Literary Evidence Retrieval via Long-Context Language Models
par: Thai, Katherine, et autres
Publié: (2025)
par: Thai, Katherine, et autres
Publié: (2025)
Debate-to-Write: A Persona-Driven Multi-Agent Framework for Diverse Argument Generation
par: Hu, Zhe, et autres
Publié: (2024)
par: Hu, Zhe, et autres
Publié: (2024)
LLMs as Debate Partners: Utilizing Genetic Algorithms and Adversarial Search for Adaptive Arguments
par: Aryan, Prakash
Publié: (2024)
par: Aryan, Prakash
Publié: (2024)
NexusSum: Hierarchical LLM Agents for Long-Form Narrative Summarization
par: Kim, Hyuntak, et autres
Publié: (2025)
par: Kim, Hyuntak, et autres
Publié: (2025)
ArgBench: Benchmarking LLMs on Computational Argumentation Tasks
par: Ajjour, Yamen, et autres
Publié: (2026)
par: Ajjour, Yamen, et autres
Publié: (2026)
Argumentation for Explainable and Globally Contestable Decision Support with LLMs
par: Dejl, Adam, et autres
Publié: (2026)
par: Dejl, Adam, et autres
Publié: (2026)
Understanding the Collapse of LLMs in Model Editing
par: Yang, Wanli, et autres
Publié: (2024)
par: Yang, Wanli, et autres
Publié: (2024)
CaLMQA: Exploring culturally specific long-form question answering across 23 languages
par: Arora, Shane, et autres
Publié: (2024)
par: Arora, Shane, et autres
Publié: (2024)
End-to-End Graph Flattening Method for Large Language Models
par: Hong, Bin, et autres
Publié: (2024)
par: Hong, Bin, et autres
Publié: (2024)
Leveraging Large Language Models for Suicide Detection on Social Media with Limited Labels
par: Nguyen, Vy, et autres
Publié: (2024)
par: Nguyen, Vy, et autres
Publié: (2024)
Fine-Grained Uncertainty Quantification for Long-Form Language Model Outputs: A Comparative Study
par: Bouchard, Dylan, et autres
Publié: (2026)
par: Bouchard, Dylan, et autres
Publié: (2026)
The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers
par: Islam, Saad Obaid ul, et autres
Publié: (2025)
par: Islam, Saad Obaid ul, et autres
Publié: (2025)
Let Models Speak Ciphers: Multiagent Debate through Embeddings
par: Pham, Chau, et autres
Publié: (2023)
par: Pham, Chau, et autres
Publié: (2023)
OpenDebateEvidence: A Massive-Scale Argument Mining and Summarization Dataset
par: Roush, Allen, et autres
Publié: (2024)
par: Roush, Allen, et autres
Publié: (2024)
Compact Prompting in Instruction-tuned LLMs for Joint Argumentative Component Detection
par: Elguendouze, Sofiane, et autres
Publié: (2026)
par: Elguendouze, Sofiane, et autres
Publié: (2026)
Documents similaires
-
CLIPPER: Compression enables long-context synthetic data generation
par: Pham, Chau Minh, et autres
Publié: (2025) -
BEARCUBS: A benchmark for computer-using web agents
par: Song, Yixiao, et autres
Publié: (2025) -
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
par: Chang, Yapei, et autres
Publié: (2025) -
FABLES: Evaluating faithfulness and content selection in book-length summarization
par: Kim, Yekyung, et autres
Publié: (2024) -
BooookScore: A systematic exploration of book-length summarization in the era of LLMs
par: Chang, Yapei, et autres
Publié: (2023)