How2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chang, Yapei, Lo, Kyle, Iyyer, Mohit, Soldaini, Luca |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BooookScore: A systematic exploration of book-length summarization in the era of LLMs
par: Chang, Yapei, et autres
Publié: (2023)
par: Chang, Yapei, et autres
Publié: (2023)
PostMark: A Robust Blackbox Watermark for Large Language Models
par: Chang, Yapei, et autres
Publié: (2024)
par: Chang, Yapei, et autres
Publié: (2024)
Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs
par: Samuel, Vinay, et autres
Publié: (2026)
par: Samuel, Vinay, et autres
Publié: (2026)
BEARCUBS: A benchmark for computer-using web agents
par: Song, Yixiao, et autres
Publié: (2025)
par: Song, Yixiao, et autres
Publié: (2025)
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
par: Chang, Yapei, et autres
Publié: (2025)
par: Chang, Yapei, et autres
Publié: (2025)
Argument Collapse: LLMs Flatten Long-Form Public Debate
par: Kim, Yekyung, et autres
Publié: (2026)
par: Kim, Yekyung, et autres
Publié: (2026)
CLIPPER: Compression enables long-context synthetic data generation
par: Pham, Chau Minh, et autres
Publié: (2025)
par: Pham, Chau Minh, et autres
Publié: (2025)
FollowIR: Evaluating and Teaching Information Retrieval Models to Follow Instructions
par: Weller, Orion, et autres
Publié: (2024)
par: Weller, Orion, et autres
Publié: (2024)
FABLES: Evaluating faithfulness and content selection in book-length summarization
par: Kim, Yekyung, et autres
Publié: (2024)
par: Kim, Yekyung, et autres
Publié: (2024)
OverThink: Slowdown Attacks on Reasoning LLMs
par: Kumar, Abhinav, et autres
Publié: (2025)
par: Kumar, Abhinav, et autres
Publié: (2025)
Olmix: A Framework for Data Mixing Throughout LM Development
par: Chen, Mayee F., et autres
Publié: (2026)
par: Chen, Mayee F., et autres
Publié: (2026)
olmOCR 2: Unit Test Rewards for Document OCR
par: Poznanski, Jake, et autres
Publié: (2025)
par: Poznanski, Jake, et autres
Publié: (2025)
How Far Can Fairness Constraints Help Recover From Biased Data?
par: Sharma, Mohit, et autres
Publié: (2023)
par: Sharma, Mohit, et autres
Publié: (2023)
DataDecide: How to Predict Best Pretraining Data with Small Experiments
par: Magnusson, Ian, et autres
Publié: (2025)
par: Magnusson, Ian, et autres
Publié: (2025)
Evaluating LLMs' Reasoning Over Ordered Procedural Steps
par: Anika, Adrita, et autres
Publié: (2025)
par: Anika, Adrita, et autres
Publié: (2025)
How Random is Random? Evaluating the Randomness and Humaness of LLMs' Coin Flips
par: Van Koevering, Katherine, et autres
Publié: (2024)
par: Van Koevering, Katherine, et autres
Publié: (2024)
Evaluating the Robustness of the "Ensemble Everything Everywhere" Defense
par: Zhang, Jie, et autres
Publié: (2024)
par: Zhang, Jie, et autres
Publié: (2024)
Paloma: A Benchmark for Evaluating Language Model Fit
par: Magnusson, Ian, et autres
Publié: (2023)
par: Magnusson, Ian, et autres
Publié: (2023)
CaLMQA: Exploring culturally specific long-form question answering across 23 languages
par: Arora, Shane, et autres
Publié: (2024)
par: Arora, Shane, et autres
Publié: (2024)
Contextualized Evaluations: Judging Language Model Responses to Underspecified Queries
par: Malaviya, Chaitanya, et autres
Publié: (2024)
par: Malaviya, Chaitanya, et autres
Publié: (2024)
Teaching Models to Understand (but not Generate) High-risk Data
par: Wang, Ryan, et autres
Publié: (2025)
par: Wang, Ryan, et autres
Publié: (2025)
How Vulnerable Are Edge LLMs?
par: Ding, Ao, et autres
Publié: (2026)
par: Ding, Ao, et autres
Publié: (2026)
How Out-of-Equilibrium Phase Transitions can Seed Pattern Formation in Trained Diffusion Models
par: Ambrogioni, Luca
Publié: (2026)
par: Ambrogioni, Luca
Publié: (2026)
Improving Reinforcement Learning Sample-Efficiency using Local Approximation
par: Prashant, Mohit, et autres
Publié: (2025)
par: Prashant, Mohit, et autres
Publié: (2025)
Towards Cross-Table Masked Pretraining for Web Data Mining
par: Ye, Chao, et autres
Publié: (2023)
par: Ye, Chao, et autres
Publié: (2023)
Exploring How LLMs Capture and Represent Domain-Specific Knowledge
par: Garcia, Mirian Hipolito, et autres
Publié: (2025)
par: Garcia, Mirian Hipolito, et autres
Publié: (2025)
How can representation dimension dominate structurally pruned LLMs?
par: Xu, Mingxue, et autres
Publié: (2025)
par: Xu, Mingxue, et autres
Publié: (2025)
How do Machine Learning Models Change?
par: Castaño, Joel, et autres
Publié: (2024)
par: Castaño, Joel, et autres
Publié: (2024)
MillStone: How Open-Minded Are LLMs?
par: Triedman, Harold, et autres
Publié: (2025)
par: Triedman, Harold, et autres
Publié: (2025)
Why LLMs Cannot Think and How to Fix It
par: Jahrens, Marius, et autres
Publié: (2025)
par: Jahrens, Marius, et autres
Publié: (2025)
How Good Are LLMs at Processing Tool Outputs?
par: Kate, Kiran, et autres
Publié: (2025)
par: Kate, Kiran, et autres
Publié: (2025)
How Does Quantization Affect Multilingual LLMs?
par: Marchisio, Kelly, et autres
Publié: (2024)
par: Marchisio, Kelly, et autres
Publié: (2024)
How Neural Losses Shape VAE Latents
par: Strano, Giorgio, et autres
Publié: (2026)
par: Strano, Giorgio, et autres
Publié: (2026)
How to Train Your LLM Web Agent: A Statistical Diagnosis
par: Vattikonda, Dheeraj, et autres
Publié: (2025)
par: Vattikonda, Dheeraj, et autres
Publié: (2025)
Self-Directed Synthetic Dialogues and Revisions Technical Report
par: Lambert, Nathan, et autres
Publié: (2024)
par: Lambert, Nathan, et autres
Publié: (2024)
How Compositional Generalization and Creativity Improve as Diffusion Models are Trained
par: Favero, Alessandro, et autres
Publié: (2025)
par: Favero, Alessandro, et autres
Publié: (2025)
How Susceptible are LLMs to Influence in Prompts?
par: Anagnostidis, Sotiris, et autres
Publié: (2024)
par: Anagnostidis, Sotiris, et autres
Publié: (2024)
How to Train Data-Efficient LLMs
par: Sachdeva, Noveen, et autres
Publié: (2024)
par: Sachdeva, Noveen, et autres
Publié: (2024)
Evaluating the Unseen Capabilities: How Many Theorems Do LLMs Know?
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
Retrieval-Augmented Mining of Temporal Logic Specifications from Data
par: Saveri, Gaia, et autres
Publié: (2024)
par: Saveri, Gaia, et autres
Publié: (2024)
Documents similaires
-
BooookScore: A systematic exploration of book-length summarization in the era of LLMs
par: Chang, Yapei, et autres
Publié: (2023) -
PostMark: A Robust Blackbox Watermark for Large Language Models
par: Chang, Yapei, et autres
Publié: (2024) -
Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs
par: Samuel, Vinay, et autres
Publié: (2026) -
BEARCUBS: A benchmark for computer-using web agents
par: Song, Yixiao, et autres
Publié: (2025) -
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
par: Chang, Yapei, et autres
Publié: (2025)