ScoNe: Benchmarking Negation Reasoning in Language Models With Fine-Tuning and In-Context Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | She, Jingyuan Selena, Potts, Christopher, Bowman, Samuel R., Geiger, Atticus |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations
par: Huang, Jing, et autres
Publié: (2024)
par: Huang, Jing, et autres
Publié: (2024)
ReFT: Representation Finetuning for Language Models
par: Wu, Zhengxuan, et autres
Publié: (2024)
par: Wu, Zhengxuan, et autres
Publié: (2024)
Constructing Interpretable Features from Compositional Neuron Groups
par: Shafran, Or, et autres
Publié: (2025)
par: Shafran, Or, et autres
Publié: (2025)
HyperSteer: Activation Steering at Scale with Hypernetworks
par: Sun, Jiuding, et autres
Publié: (2025)
par: Sun, Jiuding, et autres
Publié: (2025)
How Do Transformers Learn Variable Binding in Symbolic Programs?
par: Wu, Yiwei, et autres
Publié: (2025)
par: Wu, Yiwei, et autres
Publié: (2025)
Mixing Mechanisms: How Language Models Retrieve Bound Entities In-Context
par: Gur-Arieh, Yoav, et autres
Publié: (2025)
par: Gur-Arieh, Yoav, et autres
Publié: (2025)
pyvene: A Library for Understanding and Improving PyTorch Models via Interventions
par: Wu, Zhengxuan, et autres
Publié: (2024)
par: Wu, Zhengxuan, et autres
Publié: (2024)
How Causal Abstraction Underpins Computational Explanation
par: Geiger, Atticus, et autres
Publié: (2025)
par: Geiger, Atticus, et autres
Publié: (2025)
Recurrent Neural Networks Learn to Store and Generate Sequences using Non-Linear Representations
par: Csordás, Róbert, et autres
Publié: (2024)
par: Csordás, Róbert, et autres
Publié: (2024)
HyperDAS: Towards Automating Mechanistic Interpretability with Hypernetworks
par: Sun, Jiuding, et autres
Publié: (2025)
par: Sun, Jiuding, et autres
Publié: (2025)
A Reply to Makelov et al. (2023)'s "Interpretability Illusion" Arguments
par: Wu, Zhengxuan, et autres
Publié: (2024)
par: Wu, Zhengxuan, et autres
Publié: (2024)
Simple Mechanistic Explanations for Out-Of-Context Reasoning
par: Wang, Atticus, et autres
Publié: (2025)
par: Wang, Atticus, et autres
Publié: (2025)
Fine-Tuning and Prompt Optimization: Two Great Steps that Work Better Together
par: Soylu, Dilara, et autres
Publié: (2024)
par: Soylu, Dilara, et autres
Publié: (2024)
Interpretability at Scale: Identifying Causal Mechanisms in Alpaca
par: Wu, Zhengxuan, et autres
Publié: (2023)
par: Wu, Zhengxuan, et autres
Publié: (2023)
AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders
par: Wu, Zhengxuan, et autres
Publié: (2025)
par: Wu, Zhengxuan, et autres
Publié: (2025)
Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought
par: Boppana, Siddharth, et autres
Publié: (2026)
par: Boppana, Siddharth, et autres
Publié: (2026)
Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space
par: Bigelow, Eric, et autres
Publié: (2026)
par: Bigelow, Eric, et autres
Publié: (2026)
In-Context Learning and Fine-Tuning GPT for Argument Mining
par: Cabessa, Jérémie, et autres
Publié: (2024)
par: Cabessa, Jérémie, et autres
Publié: (2024)
Updating CLIP to Prefer Descriptions Over Captions
par: Zur, Amir, et autres
Publié: (2024)
par: Zur, Amir, et autres
Publié: (2024)
Activation Steering via Generative Causal Mediation
par: Sankaranarayanan, Aruna, et autres
Publié: (2026)
par: Sankaranarayanan, Aruna, et autres
Publié: (2026)
Demystifying Verbatim Memorization in Large Language Models
par: Huang, Jing, et autres
Publié: (2024)
par: Huang, Jing, et autres
Publié: (2024)
Fine-Tuning Language Models with Reward Learning on Policy
par: Lang, Hao, et autres
Publié: (2024)
par: Lang, Hao, et autres
Publié: (2024)
Reasoning Towards Fairness: Mitigating Bias in Language Models through Reasoning-Guided Fine-Tuning
par: Kabra, Sanchit, et autres
Publié: (2025)
par: Kabra, Sanchit, et autres
Publié: (2025)
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
par: Lee, Chungpa, et autres
Publié: (2026)
par: Lee, Chungpa, et autres
Publié: (2026)
In-Context Fine-Tuning for Time-Series Foundation Models
par: Das, Abhimanyu, et autres
Publié: (2024)
par: Das, Abhimanyu, et autres
Publié: (2024)
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
par: Tiwari, Utkarsh, et autres
Publié: (2025)
par: Tiwari, Utkarsh, et autres
Publié: (2025)
Deeper Insights Without Updates: The Power of In-Context Learning Over Fine-Tuning
par: Yin, Qingyu, et autres
Publié: (2024)
par: Yin, Qingyu, et autres
Publié: (2024)
Enhancing Event Reasoning in Large Language Models through Instruction Fine-Tuning with Semantic Causal Graphs
par: Bethany, Mazal, et autres
Publié: (2024)
par: Bethany, Mazal, et autres
Publié: (2024)
Fine-Tuning Language Models with Just Forward Passes
par: Malladi, Sadhika, et autres
Publié: (2023)
par: Malladi, Sadhika, et autres
Publié: (2023)
Dissecting Fine-Tuning Unlearning in Large Language Models
par: Hong, Yihuai, et autres
Publié: (2024)
par: Hong, Yihuai, et autres
Publié: (2024)
Reasoning Planning for Language Models
par: Nguyen, Bao, et autres
Publié: (2025)
par: Nguyen, Bao, et autres
Publié: (2025)
Steering Without Side Effects: Improving Post-Deployment Control of Language Models
par: Stickland, Asa Cooper, et autres
Publié: (2024)
par: Stickland, Asa Cooper, et autres
Publié: (2024)
Evaluating Open-Source Sparse Autoencoders on Disentangling Factual Knowledge in GPT-2 Small
par: Chaudhary, Maheep, et autres
Publié: (2024)
par: Chaudhary, Maheep, et autres
Publié: (2024)
LUNE: Efficient LLM Unlearning via LoRA Fine-Tuning with Negative Examples
par: Liu, Yezi, et autres
Publié: (2025)
par: Liu, Yezi, et autres
Publié: (2025)
From Directions to Regions: Decomposing Activations in Language Models via Local Geometry
par: Shafran, Or, et autres
Publié: (2026)
par: Shafran, Or, et autres
Publié: (2026)
Personalized Collaborative Fine-Tuning for On-Device Large Language Models
par: Wagner, Nicolas, et autres
Publié: (2024)
par: Wagner, Nicolas, et autres
Publié: (2024)
How Multilingual Are Large Language Models Fine-Tuned for Translation?
par: Richburg, Aquia, et autres
Publié: (2024)
par: Richburg, Aquia, et autres
Publié: (2024)
Out-of-Context Reasoning in Large Language Models
par: Shaki, Jonathan, et autres
Publié: (2025)
par: Shaki, Jonathan, et autres
Publié: (2025)
Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning
par: Cai, Hengrui, et autres
Publié: (2023)
par: Cai, Hengrui, et autres
Publié: (2023)
Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models
par: Solway, Alec
Publié: (2024)
par: Solway, Alec
Publié: (2024)
Documents similaires
-
RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations
par: Huang, Jing, et autres
Publié: (2024) -
ReFT: Representation Finetuning for Language Models
par: Wu, Zhengxuan, et autres
Publié: (2024) -
Constructing Interpretable Features from Compositional Neuron Groups
par: Shafran, Or, et autres
Publié: (2025) -
HyperSteer: Activation Steering at Scale with Hypernetworks
par: Sun, Jiuding, et autres
Publié: (2025) -
How Do Transformers Learn Variable Binding in Symbolic Programs?
par: Wu, Yiwei, et autres
Publié: (2025)