iFlip: Iterative Feedback-driven Counterfactual Example Refinement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yilong, Wang, Qianli, Feldhus, Nils |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FitCF: A Framework for Automatic Feature Importance-guided Counterfactual Example Generation
par: Wang, Qianli, et autres
Publié: (2025)
par: Wang, Qianli, et autres
Publié: (2025)
Cross-Refine: Improving Natural Language Explanation Generation by Learning in Tandem
par: Wang, Qianli, et autres
Publié: (2024)
par: Wang, Qianli, et autres
Publié: (2024)
Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization
par: Sun, Jingyi, et autres
Publié: (2026)
par: Sun, Jingyi, et autres
Publié: (2026)
Through a Compressed Lens: Investigating The Impact of Quantization on Factual Knowledge Recall
par: Wang, Qianli, et autres
Publié: (2025)
par: Wang, Qianli, et autres
Publié: (2025)
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
par: Wang, Qianli, et autres
Publié: (2024)
par: Wang, Qianli, et autres
Publié: (2024)
Interpreting Language Models Through Concept Descriptions: A Survey
par: Feldhus, Nils, et autres
Publié: (2025)
par: Feldhus, Nils, et autres
Publié: (2025)
Truth or Twist? Optimal Model Selection for Reliable Label Flipping Evaluation in LLM-based Counterfactuals
par: Wang, Qianli, et autres
Publié: (2025)
par: Wang, Qianli, et autres
Publié: (2025)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
par: Wang, Qianli, et autres
Publié: (2026)
par: Wang, Qianli, et autres
Publié: (2026)
Simplifying Outcomes of Language Model Component Analyses with ELIA
par: Eidt, Aaron Louis, et autres
Publié: (2026)
par: Eidt, Aaron Louis, et autres
Publié: (2026)
Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation
par: Wang, Qianli, et autres
Publié: (2026)
par: Wang, Qianli, et autres
Publié: (2026)
Gender Bias in Explainability: Investigating Performance Disparity in Post-hoc Methods
par: Dhaini, Mahdi, et autres
Publié: (2025)
par: Dhaini, Mahdi, et autres
Publié: (2025)
Iterative Counterfactual Data Augmentation
par: Plyler, Mitchell, et autres
Publié: (2025)
par: Plyler, Mitchell, et autres
Publié: (2025)
Judge Circuits
par: Feldhus, Nils, et autres
Publié: (2026)
par: Feldhus, Nils, et autres
Publié: (2026)
CoXQL: A Dataset for Parsing Explanation Requests in Conversational XAI Systems
par: Wang, Qianli, et autres
Publié: (2024)
par: Wang, Qianli, et autres
Publié: (2024)
What Will My Model Forget? Forecasting Forgotten Examples in Language Model Refinement
par: Jin, Xisen, et autres
Publié: (2024)
par: Jin, Xisen, et autres
Publié: (2024)
Reasoning Elicitation in Language Models via Counterfactual Feedback
par: Hüyük, Alihan, et autres
Publié: (2024)
par: Hüyük, Alihan, et autres
Publié: (2024)
ProRefine: Inference-Time Prompt Refinement with Textual Feedback
par: Pandita, Deepak, et autres
Publié: (2025)
par: Pandita, Deepak, et autres
Publié: (2025)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
par: Zeng, Xingshan, et autres
Publié: (2025)
par: Zeng, Xingshan, et autres
Publié: (2025)
Iterative Augmentation with Summarization Refinement (IASR) Evaluation for Unstructured Survey data Modeling and Analysis
par: Bhattad, Payal, et autres
Publié: (2025)
par: Bhattad, Payal, et autres
Publié: (2025)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
par: Xiong, Weimin, et autres
Publié: (2024)
par: Xiong, Weimin, et autres
Publié: (2024)
Evolutionary Guided Decoding: Iterative Value Refinement for LLMs
par: Liu, Zhenhua, et autres
Publié: (2025)
par: Liu, Zhenhua, et autres
Publié: (2025)
Flipping Against All Odds: Reducing LLM Coin Flip Bias via Verbalized Rejection Sampling
par: Xiao, Tim Z., et autres
Publié: (2025)
par: Xiao, Tim Z., et autres
Publié: (2025)
Capturing Polysemanticity with PRISM: A Multi-Concept Feature Description Framework
par: Kopf, Laura, et autres
Publié: (2025)
par: Kopf, Laura, et autres
Publié: (2025)
Can LLMs Learn New Concepts Incrementally without Forgetting?
par: Zheng, Junhao, et autres
Publié: (2024)
par: Zheng, Junhao, et autres
Publié: (2024)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
par: Zheng, Junhao, et autres
Publié: (2023)
par: Zheng, Junhao, et autres
Publié: (2023)
Permute-and-Flip: An optimally stable and watermarkable decoder for LLMs
par: Zhao, Xuandong, et autres
Publié: (2024)
par: Zhao, Xuandong, et autres
Publié: (2024)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
par: Wang, Yilong, et autres
Publié: (2026)
par: Wang, Yilong, et autres
Publié: (2026)
De Jure: Iterative LLM Self-Refinement for Structured Extraction of Regulatory Rules
par: Guliani, Keerat, et autres
Publié: (2026)
par: Guliani, Keerat, et autres
Publié: (2026)
When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models
par: Yoon, Youngsik, et autres
Publié: (2026)
par: Yoon, Youngsik, et autres
Publié: (2026)
Self-Refinement of Language Models from External Proxy Metrics Feedback
par: Ramji, Keshav, et autres
Publié: (2024)
par: Ramji, Keshav, et autres
Publié: (2024)
Counterfactual Generation with Identifiability Guarantees
par: Yan, Hanqi, et autres
Publié: (2024)
par: Yan, Hanqi, et autres
Publié: (2024)
A Gradient Analysis Framework for Rewarding Good and Penalizing Bad Examples in Language Models
par: Tuan, Yi-Lin, et autres
Publié: (2024)
par: Tuan, Yi-Lin, et autres
Publié: (2024)
Towards Lifelong Learning of Large Language Models: A Survey
par: Zheng, Junhao, et autres
Publié: (2024)
par: Zheng, Junhao, et autres
Publié: (2024)
Stealing Creator's Workflow: A Creator-Inspired Agentic Framework with Iterative Feedback Loop for Improved Scientific Short-form Generation
par: Park, Jong Inn, et autres
Publié: (2025)
par: Park, Jong Inn, et autres
Publié: (2025)
Feedback-Driven Vision-Language Alignment with Minimal Human Supervision
par: Giannone, Giorgio, et autres
Publié: (2025)
par: Giannone, Giorgio, et autres
Publié: (2025)
iFairy: the First 2-bit Complex LLM with All Parameters in $\{\pm1, \pm i\}$
par: Wang, Feiyu, et autres
Publié: (2025)
par: Wang, Feiyu, et autres
Publié: (2025)
Iterative Label Refinement Matters More than Preference Optimization under Weak Supervision
par: Ye, Yaowen, et autres
Publié: (2025)
par: Ye, Yaowen, et autres
Publié: (2025)
CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples
par: Zhang, Jianrui, et autres
Publié: (2024)
par: Zhang, Jianrui, et autres
Publié: (2024)
Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs
par: Hejabi, Parsa, et autres
Publié: (2025)
par: Hejabi, Parsa, et autres
Publié: (2025)
Aligning (Medical) LLMs for (Counterfactual) Fairness
par: Poulain, Raphael, et autres
Publié: (2024)
par: Poulain, Raphael, et autres
Publié: (2024)
Documents similaires
-
FitCF: A Framework for Automatic Feature Importance-guided Counterfactual Example Generation
par: Wang, Qianli, et autres
Publié: (2025) -
Cross-Refine: Improving Natural Language Explanation Generation by Learning in Tandem
par: Wang, Qianli, et autres
Publié: (2024) -
Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization
par: Sun, Jingyi, et autres
Publié: (2026) -
Through a Compressed Lens: Investigating The Impact of Quantization on Factual Knowledge Recall
par: Wang, Qianli, et autres
Publié: (2025) -
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
par: Wang, Qianli, et autres
Publié: (2024)