What is Your Data Worth to GPT? LLM-Scale Data Valuation with Influence Functions
Fuente:
arXiv
Guardado en:
| Autores principales: | Choe, Sang Keun, Ahn, Hwijeen, Bae, Juhan, Zhao, Kewen, Kang, Minsoo, Chung, Youngseog, Pratapa, Adithya, Neiswanger, Willie, Strubell, Emma, Mitamura, Teruko, Schneider, Jeff, Hovy, Eduard, Grosse, Roger, Xing, Eric |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scaling Multi-Document Event Summarization: Evaluating Compression vs. Full-Text Approaches
por: Pratapa, Adithya, et al.
Publicado: (2025)
por: Pratapa, Adithya, et al.
Publicado: (2025)
Estimating Optimal Context Length for Hybrid Retrieval-augmented Multi-document Summarization
por: Pratapa, Adithya, et al.
Publicado: (2025)
por: Pratapa, Adithya, et al.
Publicado: (2025)
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
por: Bertsch, Amanda, et al.
Publicado: (2025)
por: Bertsch, Amanda, et al.
Publicado: (2025)
Can AI Examine Novelty of Patents?: Novelty Evaluation Based on the Correspondence between Patent Claim and Prior Art
por: Ikoma, Hayato, et al.
Publicado: (2025)
por: Ikoma, Hayato, et al.
Publicado: (2025)
Training Data Attribution via Approximate Unrolled Differentiation
por: Bae, Juhan, et al.
Publicado: (2024)
por: Bae, Juhan, et al.
Publicado: (2024)
TAMA: Tool-Augmented Multimodal Agent for Procedural Activity Understanding
por: Hasegawa, Kimihiro, et al.
Publicado: (2025)
por: Hasegawa, Kimihiro, et al.
Publicado: (2025)
Formulation Comparison for Timeline Construction using LLMs
por: Hasegawa, Kimihiro, et al.
Publicado: (2024)
por: Hasegawa, Kimihiro, et al.
Publicado: (2024)
ColBERT Retrieval and Ensemble Response Scoring for Language Model Question Answering
por: Gichamba, Alex, et al.
Publicado: (2024)
por: Gichamba, Alex, et al.
Publicado: (2024)
Spatial Alignment of Multimodal Expression
por: Pratapa, Aditya
Publicado: (2026)
por: Pratapa, Aditya
Publicado: (2026)
Better Training Data Attribution via Better Inverse Hessian-Vector Products
por: Wang, Andrew, et al.
Publicado: (2025)
por: Wang, Andrew, et al.
Publicado: (2025)
DeLLMa: Decision Making Under Uncertainty with Large Language Models
por: Liu, Ollie, et al.
Publicado: (2024)
por: Liu, Ollie, et al.
Publicado: (2024)
Probabilistic Graphical Models: A Concise Tutorial
por: Maasch, Jacqueline, et al.
Publicado: (2025)
por: Maasch, Jacqueline, et al.
Publicado: (2025)
Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?
por: Zhu, Wang Bill, et al.
Publicado: (2026)
por: Zhu, Wang Bill, et al.
Publicado: (2026)
Exploring Training Data Attribution under Limited Access Constraints
por: Zhang, Shiyuan, et al.
Publicado: (2025)
por: Zhang, Shiyuan, et al.
Publicado: (2025)
Training Data Attribution (TDA): Examining Its Adoption & Use Cases
por: Cheng, Deric, et al.
Publicado: (2025)
por: Cheng, Deric, et al.
Publicado: (2025)
METAGENE-1: Metagenomic Foundation Model for Pandemic Monitoring
por: Liu, Ollie, et al.
Publicado: (2025)
por: Liu, Ollie, et al.
Publicado: (2025)
Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning
por: Akgül, Ömer Faruk, et al.
Publicado: (2026)
por: Akgül, Ömer Faruk, et al.
Publicado: (2026)
A Video-grounded Dialogue Dataset and Metric for Event-driven Activities
por: Imrattanatrai, Wiradee, et al.
Publicado: (2025)
por: Imrattanatrai, Wiradee, et al.
Publicado: (2025)
Triggered: A Statistical Analysis of Environmental Influences on Extremist Groups
por: de Kock, Christine, et al.
Publicado: (2026)
por: de Kock, Christine, et al.
Publicado: (2026)
Full Shot Predictions for the DIII-D Tokamak via Deep Recurrent Networks
por: Char, Ian, et al.
Publicado: (2024)
por: Char, Ian, et al.
Publicado: (2024)
Beyond Parameter Count: Implicit Bias in Soft Mixture of Experts
por: Chung, Youngseog, et al.
Publicado: (2024)
por: Chung, Youngseog, et al.
Publicado: (2024)
LLM Unlearning Without an Expert Curated Dataset
por: Zhu, Xiaoyuan, et al.
Publicado: (2025)
por: Zhu, Xiaoyuan, et al.
Publicado: (2025)
Supercharging Simulation-Based Inference for Bayesian Optimal Experimental Design
por: Klein, Samuel, et al.
Publicado: (2026)
por: Klein, Samuel, et al.
Publicado: (2026)
Uncertainty Quantification for Forward and Inverse Problems of PDEs via Latent Global Evolution
por: Wu, Tailin, et al.
Publicado: (2024)
por: Wu, Tailin, et al.
Publicado: (2024)
Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions
por: Zhang, Jiarui, et al.
Publicado: (2024)
por: Zhang, Jiarui, et al.
Publicado: (2024)
From Calibration to Collaboration: LLM Uncertainty Quantification Should Be More Human-Centered
por: Devic, Siddartha, et al.
Publicado: (2025)
por: Devic, Siddartha, et al.
Publicado: (2025)
Marketing the Worth of Your Library.
por: Sass, Rivkah K.
Publicado: (2002)
por: Sass, Rivkah K.
Publicado: (2002)
The State of money in circulation and its reform in Konbaung Burma : The 1790s–1860s / Teruko Saito
por: Saito, Teruko
por: Saito, Teruko
Envisioning Mobile Data Visualization Libraries for Digital Health
por: Lee, Bongshin, et al.
Publicado: (2026)
por: Lee, Bongshin, et al.
Publicado: (2026)
FLUX: Data Worth Training On
por: Gowtham, et al.
Publicado: (2026)
por: Gowtham, et al.
Publicado: (2026)
Influence Functions for Scalable Data Attribution in Diffusion Models
por: Mlodozeniec, Bruno, et al.
Publicado: (2024)
por: Mlodozeniec, Bruno, et al.
Publicado: (2024)
Data Distribution Valuation
por: Xu, Xinyi, et al.
Publicado: (2024)
por: Xu, Xinyi, et al.
Publicado: (2024)
Modelos teóricos atuais da dislexia do desenvolvimento
por: Olinda Teruko Kajihara
Publicado: (2008)
por: Olinda Teruko Kajihara
Publicado: (2008)
El projecte Atlantis: recursos digitals per a les llengües minoritzades de la UE, recursos per a l´ensenyament del català
por: Miquel Strubell
Publicado: (2003)
por: Miquel Strubell
Publicado: (2003)
ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
por: Hasegawa, Kimihiro, et al.
Publicado: (2025)
por: Hasegawa, Kimihiro, et al.
Publicado: (2025)
Hype Has Worth: Attention, Sentiment, and NFT Valuation in Major Ethereum Collections
por: Tariq, Samiha
Publicado: (2026)
por: Tariq, Samiha
Publicado: (2026)
Light Pentaquark Searches with Hadron Beams
por: Ahn, Jung Keun
Publicado: (2025)
por: Ahn, Jung Keun
Publicado: (2025)
Flat Midgap Topological Surface and Hypersurface Bands without Parameter Tuning
por: Ahn, Keun Hyuk
Publicado: (2025)
por: Ahn, Keun Hyuk
Publicado: (2025)
Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection
por: Anwar, Abrar, et al.
Publicado: (2025)
por: Anwar, Abrar, et al.
Publicado: (2025)
LYNX: Learning Dynamic Exits for Confidence-Controlled Reasoning
por: Akgül, Ömer Faruk, et al.
Publicado: (2025)
por: Akgül, Ömer Faruk, et al.
Publicado: (2025)
Ejemplares similares
-
Scaling Multi-Document Event Summarization: Evaluating Compression vs. Full-Text Approaches
por: Pratapa, Adithya, et al.
Publicado: (2025) -
Estimating Optimal Context Length for Hybrid Retrieval-augmented Multi-document Summarization
por: Pratapa, Adithya, et al.
Publicado: (2025) -
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
por: Bertsch, Amanda, et al.
Publicado: (2025) -
Can AI Examine Novelty of Patents?: Novelty Evaluation Based on the Correspondence between Patent Claim and Prior Art
por: Ikoma, Hayato, et al.
Publicado: (2025) -
Training Data Attribution via Approximate Unrolled Differentiation
por: Bae, Juhan, et al.
Publicado: (2024)