On the Feasibility of In-Context Probing for Data Attribution
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiao, Cathy, Gao, Gary, Raghunathan, Aditi, Xiong, Chenyan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fairshare Data Pricing via Data Valuation for Large Language Models
par: Zhang, Luyang, et autres
Publié: (2025)
par: Zhang, Luyang, et autres
Publié: (2025)
DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
par: Jiao, Cathy, et autres
Publié: (2025)
par: Jiao, Cathy, et autres
Publié: (2025)
Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance
par: Goyal, Sachin, et autres
Publié: (2024)
par: Goyal, Sachin, et autres
Publié: (2024)
Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs
par: Zhong, Ziqian, et autres
Publié: (2025)
par: Zhong, Ziqian, et autres
Publié: (2025)
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
par: Yu, Zichun, et autres
Publié: (2026)
par: Yu, Zichun, et autres
Publié: (2026)
MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models
par: Yu, Zichun, et autres
Publié: (2024)
par: Yu, Zichun, et autres
Publié: (2024)
Self-Trained Verification for Training- and Test-Time Self-Improvement
par: Wu, Chen Henry, et autres
Publié: (2026)
par: Wu, Chen Henry, et autres
Publié: (2026)
Understanding Finetuning for Factual Knowledge Extraction
par: Ghosal, Gaurav, et autres
Publié: (2024)
par: Ghosal, Gaurav, et autres
Publié: (2024)
ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases
par: Zhong, Ziqian, et autres
Publié: (2025)
par: Zhong, Ziqian, et autres
Publié: (2025)
Understanding the Influence of Synthetic Data for Text Embedders
par: Springer, Jacob Mitchell, et autres
Publié: (2025)
par: Springer, Jacob Mitchell, et autres
Publié: (2025)
Intercept Cancer: Cancer Pre-Screening with Large Scale Healthcare Foundation Models
par: Sun, Liwen, et autres
Publié: (2025)
par: Sun, Liwen, et autres
Publié: (2025)
RePro: Training Language Models to Faithfully Recycle the Web for Pretraining
par: Yu, Zichun, et autres
Publié: (2025)
par: Yu, Zichun, et autres
Publié: (2025)
Testing the Limits of Jailbreaking Defenses with the Purple Problem
par: Kim, Taeyoun, et autres
Publié: (2024)
par: Kim, Taeyoun, et autres
Publié: (2024)
Understanding Catastrophic Forgetting in Language Models via Implicit Inference
par: Kotha, Suhas, et autres
Publié: (2023)
par: Kotha, Suhas, et autres
Publié: (2023)
Montessori-Instruct: Generate Influential Training Data Tailored for Student Learning
par: Li, Xiaochuan, et autres
Publié: (2024)
par: Li, Xiaochuan, et autres
Publié: (2024)
Craw4LLM: Efficient Web Crawling for LLM Pretraining
par: Yu, Shi, et autres
Publié: (2025)
par: Yu, Shi, et autres
Publié: (2025)
Midtraining Bridges Pretraining and Posttraining Distributions
par: Liu, Emmy, et autres
Publié: (2025)
par: Liu, Emmy, et autres
Publié: (2025)
ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
par: Kang, Hao, et autres
Publié: (2024)
par: Kang, Hao, et autres
Publié: (2024)
AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning
par: Wang, Tevin, et autres
Publié: (2025)
par: Wang, Tevin, et autres
Publié: (2025)
Mitigating Bias in RAG: Controlling the Embedder
par: Kim, Taeyoun, et autres
Publié: (2025)
par: Kim, Taeyoun, et autres
Publié: (2025)
Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search
par: Shi, Wentao, et autres
Publié: (2025)
par: Shi, Wentao, et autres
Publié: (2025)
Mode-Conditioning Unlocks Superior Test-Time Scaling
par: Wu, Chen Henry, et autres
Publié: (2025)
par: Wu, Chen Henry, et autres
Publié: (2025)
An Economic Framework for Generative Engines: Advertising or Subscription?
par: Zhang, Luyang, et autres
Publié: (2026)
par: Zhang, Luyang, et autres
Publié: (2026)
RAGViz: Diagnose and Visualize Retrieval-Augmented Generation
par: Wang, Tevin, et autres
Publié: (2024)
par: Wang, Tevin, et autres
Publié: (2024)
FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models
par: Kang, Hao, et autres
Publié: (2025)
par: Kang, Hao, et autres
Publié: (2025)
Fact-Aware Multimodal Retrieval Augmentation for Accurate Medical Radiology Report Generation
par: Sun, Liwen, et autres
Publié: (2024)
par: Sun, Liwen, et autres
Publié: (2024)
Roll the dice & look before you leap: Going beyond the creative limits of next-token prediction
par: Nagarajan, Vaishnavh, et autres
Publié: (2025)
par: Nagarajan, Vaishnavh, et autres
Publié: (2025)
Repetition Improves Language Model Embeddings
par: Springer, Jacob Mitchell, et autres
Publié: (2024)
par: Springer, Jacob Mitchell, et autres
Publié: (2024)
Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting
par: Watts, Ishaan, et autres
Publié: (2026)
par: Watts, Ishaan, et autres
Publié: (2026)
Group-Level Data Selection for Efficient Pretraining
par: Yu, Zichun, et autres
Publié: (2025)
par: Yu, Zichun, et autres
Publié: (2025)
Generate, Not Recommend: Personalized Multimodal Content Generation
par: Liu, Jiongnan, et autres
Publié: (2025)
par: Liu, Jiongnan, et autres
Publié: (2025)
Toolink: Linking Toolkit Creation and Using through Chain-of-Solving on Open-Source Model
par: Qian, Cheng, et autres
Publié: (2023)
par: Qian, Cheng, et autres
Publié: (2023)
ContextCite: Attributing Model Generation to Context
par: Cohen-Wang, Benjamin, et autres
Publié: (2024)
par: Cohen-Wang, Benjamin, et autres
Publié: (2024)
Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation
par: Li, Ruizhe, et autres
Publié: (2025)
par: Li, Ruizhe, et autres
Publié: (2025)
On Synthesizing Data for Context Attribution in Question Answering
par: Radevski, Gorjan, et autres
Publié: (2025)
par: Radevski, Gorjan, et autres
Publié: (2025)
Probing How Scalable Table Data Enhances General Long-Context Reasoning
par: Xie, Huaibing, et autres
Publié: (2026)
par: Xie, Huaibing, et autres
Publié: (2026)
T-MARS: Improving Visual Representations by Circumventing Text Feature Learning
par: Maini, Pratyush, et autres
Publié: (2023)
par: Maini, Pratyush, et autres
Publié: (2023)
Ambiguity-Aware In-Context Learning with Large Language Models
par: Gao, Lingyu, et autres
Publié: (2023)
par: Gao, Lingyu, et autres
Publié: (2023)
Probing the Feasibility of Multilingual Speaker Anonymization
par: Meyer, Sarina, et autres
Publié: (2024)
par: Meyer, Sarina, et autres
Publié: (2024)
Model-Generated Pretraining Signals Improves Zero-Shot Generalization of Text-to-Text Transformers
par: Gong, Linyuan, et autres
Publié: (2023)
par: Gong, Linyuan, et autres
Publié: (2023)
Documents similaires
-
Fairshare Data Pricing via Data Valuation for Large Language Models
par: Zhang, Luyang, et autres
Publié: (2025) -
DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
par: Jiao, Cathy, et autres
Publié: (2025) -
Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance
par: Goyal, Sachin, et autres
Publié: (2024) -
Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs
par: Zhong, Ziqian, et autres
Publié: (2025) -
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
par: Yu, Zichun, et autres
Publié: (2026)