VeriFastScore: Speeding up long-form factuality evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Rajendhran, Rishanth, Zadeh, Amir, Sarte, Matthew, Li, Chuan, Iyyer, Mohit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StoryScope: Investigating idiosyncrasies in AI fiction
di: Russell, Jenna, et al.
Pubblicazione: (2026)
di: Russell, Jenna, et al.
Pubblicazione: (2026)
VERISCORE: Evaluating the factuality of verifiable claims in long-form text generation
di: Song, Yixiao, et al.
Pubblicazione: (2024)
di: Song, Yixiao, et al.
Pubblicazione: (2024)
Whispers of Doubt Amidst Echoes of Triumph in NLP Robustness
di: Gupta, Ashim, et al.
Pubblicazione: (2023)
di: Gupta, Ashim, et al.
Pubblicazione: (2023)
Frankentext: Stitching random text fragments into long-form narratives
di: Pham, Chau Minh, et al.
Pubblicazione: (2025)
di: Pham, Chau Minh, et al.
Pubblicazione: (2025)
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
di: Chang, Yapei, et al.
Pubblicazione: (2025)
di: Chang, Yapei, et al.
Pubblicazione: (2025)
CLIPPER: Compression enables long-context synthetic data generation
di: Pham, Chau Minh, et al.
Pubblicazione: (2025)
di: Pham, Chau Minh, et al.
Pubblicazione: (2025)
Suri: Multi-constraint Instruction Following for Long-form Text Generation
di: Pham, Chau Minh, et al.
Pubblicazione: (2024)
di: Pham, Chau Minh, et al.
Pubblicazione: (2024)
Localizing and Mitigating Errors in Long-form Question Answering
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2024)
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2024)
Literary Evidence Retrieval via Long-Context Language Models
di: Thai, Katherine, et al.
Pubblicazione: (2025)
di: Thai, Katherine, et al.
Pubblicazione: (2025)
One ruler to measure them all: Benchmarking multilingual long-context language models
di: Kim, Yekyung, et al.
Pubblicazione: (2025)
di: Kim, Yekyung, et al.
Pubblicazione: (2025)
BooookScore: A systematic exploration of book-length summarization in the era of LLMs
di: Chang, Yapei, et al.
Pubblicazione: (2023)
di: Chang, Yapei, et al.
Pubblicazione: (2023)
CaLMQA: Exploring culturally specific long-form question answering across 23 languages
di: Arora, Shane, et al.
Pubblicazione: (2024)
di: Arora, Shane, et al.
Pubblicazione: (2024)
Iteratively Prompting Multimodal LLMs to Reproduce Natural and AI-Generated Images
di: Naseh, Ali, et al.
Pubblicazione: (2024)
di: Naseh, Ali, et al.
Pubblicazione: (2024)
Beyond Precision: Importance-Aware Recall for Factuality Evaluation in Long-Form LLM Generation
di: Jafari, Nazanin, et al.
Pubblicazione: (2026)
di: Jafari, Nazanin, et al.
Pubblicazione: (2026)
Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs
di: Samuel, Vinay, et al.
Pubblicazione: (2026)
di: Samuel, Vinay, et al.
Pubblicazione: (2026)
Does quantization affect models' performance on long-context tasks?
di: Mekala, Anmol, et al.
Pubblicazione: (2025)
di: Mekala, Anmol, et al.
Pubblicazione: (2025)
Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
di: Lin, Han, et al.
Pubblicazione: (2025)
di: Lin, Han, et al.
Pubblicazione: (2025)
One Thousand and One Pairs: A "novel" challenge for long-context language models
di: Karpinska, Marzena, et al.
Pubblicazione: (2024)
di: Karpinska, Marzena, et al.
Pubblicazione: (2024)
Measuring short-form factuality in large language models
di: Wei, Jason, et al.
Pubblicazione: (2024)
di: Wei, Jason, et al.
Pubblicazione: (2024)
People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated text
di: Russell, Jenna, et al.
Pubblicazione: (2025)
di: Russell, Jenna, et al.
Pubblicazione: (2025)
Long-form factuality in large language models
di: Wei, Jerry, et al.
Pubblicazione: (2024)
di: Wei, Jerry, et al.
Pubblicazione: (2024)
EditLens: Quantifying the Extent of AI Editing in Text
di: Thai, Katherine, et al.
Pubblicazione: (2025)
di: Thai, Katherine, et al.
Pubblicazione: (2025)
PostMark: A Robust Blackbox Watermark for Large Language Models
di: Chang, Yapei, et al.
Pubblicazione: (2024)
di: Chang, Yapei, et al.
Pubblicazione: (2024)
Whose story is it? Personalizing story generation by inferring author styles
di: Kumar, Nischal Ashok, et al.
Pubblicazione: (2025)
di: Kumar, Nischal Ashok, et al.
Pubblicazione: (2025)
Argument Collapse: LLMs Flatten Long-Form Public Debate
di: Kim, Yekyung, et al.
Pubblicazione: (2026)
di: Kim, Yekyung, et al.
Pubblicazione: (2026)
TopicGPT: A Prompt-based Topic Modeling Framework
di: Pham, Chau Minh, et al.
Pubblicazione: (2023)
di: Pham, Chau Minh, et al.
Pubblicazione: (2023)
Large Language Models, scientific knowledge and factuality: A framework to streamline human expert evaluation
di: Wysocka, Magdalena, et al.
Pubblicazione: (2023)
di: Wysocka, Magdalena, et al.
Pubblicazione: (2023)
Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision
di: Pala, Tej Deep, et al.
Pubblicazione: (2025)
di: Pala, Tej Deep, et al.
Pubblicazione: (2025)
Contextualized Evaluations: Judging Language Model Responses to Underspecified Queries
di: Malaviya, Chaitanya, et al.
Pubblicazione: (2024)
di: Malaviya, Chaitanya, et al.
Pubblicazione: (2024)
AI use in American newspapers is widespread, uneven, and rarely disclosed
di: Russell, Jenna, et al.
Pubblicazione: (2025)
di: Russell, Jenna, et al.
Pubblicazione: (2025)
CECOR: Correction-oriented synthetic data construction for factual error correction
di: Zhu, Lei, et al.
Pubblicazione: (2026)
di: Zhu, Lei, et al.
Pubblicazione: (2026)
Collaborative decoding of critical tokens for boosting factuality of large language models
di: Jin, Lifeng, et al.
Pubblicazione: (2024)
di: Jin, Lifeng, et al.
Pubblicazione: (2024)
PromptDistill: Query-based Selective Token Retention in Intermediate Layers for Efficient Large Language Model Inference
di: Jin, Weisheng, et al.
Pubblicazione: (2025)
di: Jin, Weisheng, et al.
Pubblicazione: (2025)
MLRIP: Pre-training a military language representation model with informative factual knowledge and professional knowledge base
di: Li, Hui, et al.
Pubblicazione: (2022)
di: Li, Hui, et al.
Pubblicazione: (2022)
Interactive Topic Models with Optimal Transport
di: Dhanania, Garima, et al.
Pubblicazione: (2024)
di: Dhanania, Garima, et al.
Pubblicazione: (2024)
BEARCUBS: A benchmark for computer-using web agents
di: Song, Yixiao, et al.
Pubblicazione: (2025)
di: Song, Yixiao, et al.
Pubblicazione: (2025)
SqueezeComposer: Temporal Speed-up is A Simple Trick for Long-form Music Composing
di: Chen, Jianyi, et al.
Pubblicazione: (2026)
di: Chen, Jianyi, et al.
Pubblicazione: (2026)
On Positional Bias of Faithfulness for Long-form Summarization
di: Wan, David, et al.
Pubblicazione: (2024)
di: Wan, David, et al.
Pubblicazione: (2024)
OWL: Probing Cross-Lingual Recall of Memorized Texts via World Literature
di: Srivastava, Alisha, et al.
Pubblicazione: (2025)
di: Srivastava, Alisha, et al.
Pubblicazione: (2025)
FABLES: Evaluating faithfulness and content selection in book-length summarization
di: Kim, Yekyung, et al.
Pubblicazione: (2024)
di: Kim, Yekyung, et al.
Pubblicazione: (2024)
Documenti analoghi
-
StoryScope: Investigating idiosyncrasies in AI fiction
di: Russell, Jenna, et al.
Pubblicazione: (2026) -
VERISCORE: Evaluating the factuality of verifiable claims in long-form text generation
di: Song, Yixiao, et al.
Pubblicazione: (2024) -
Whispers of Doubt Amidst Echoes of Triumph in NLP Robustness
di: Gupta, Ashim, et al.
Pubblicazione: (2023) -
Frankentext: Stitching random text fragments into long-form narratives
di: Pham, Chau Minh, et al.
Pubblicazione: (2025) -
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
di: Chang, Yapei, et al.
Pubblicazione: (2025)