Transformers in the Dark: Navigating Unknown Search Spaces via Bandit Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Jungtaek, Zeng, Thomas, Lin, Ziqian, Lee, Minjae, Lee, Chungpa, Sohn, Jy-yong, Koo, Hyung Il, Lee, Kangwook |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
di: Lee, Chungpa, et al.
Pubblicazione: (2026)
di: Lee, Chungpa, et al.
Pubblicazione: (2026)
How to Correctly Report LLM-as-a-Judge Evaluations
di: Lee, Chungpa, et al.
Pubblicazione: (2025)
di: Lee, Chungpa, et al.
Pubblicazione: (2025)
Analysis of Using Sigmoid Loss for Contrastive Learning
di: Lee, Chungpa, et al.
Pubblicazione: (2024)
di: Lee, Chungpa, et al.
Pubblicazione: (2024)
On the Similarities of Embeddings in Contrastive Learning
di: Lee, Chungpa, et al.
Pubblicazione: (2025)
di: Lee, Chungpa, et al.
Pubblicazione: (2025)
A Theoretical Framework for Preventing Class Collapse in Supervised Contrastive Learning
di: Lee, Chungpa, et al.
Pubblicazione: (2025)
di: Lee, Chungpa, et al.
Pubblicazione: (2025)
Memorization Capacity for Additive Fine-Tuning with Small ReLU Networks
di: Sohn, Jy-yong, et al.
Pubblicazione: (2024)
di: Sohn, Jy-yong, et al.
Pubblicazione: (2024)
Draft-based Approximate Inference for LLMs
di: Galim, Kevin, et al.
Pubblicazione: (2025)
di: Galim, Kevin, et al.
Pubblicazione: (2025)
Parameter-Efficient Fine-Tuning of State Space Models
di: Galim, Kevin, et al.
Pubblicazione: (2024)
di: Galim, Kevin, et al.
Pubblicazione: (2024)
Measuring Representational Shifts in Continual Learning: A Linear Transformation Perspective
di: Kim, Joonkyu, et al.
Pubblicazione: (2025)
di: Kim, Joonkyu, et al.
Pubblicazione: (2025)
TAPE: Tool-Guided Adaptive Planning and Constrained Execution in Language Model Agents
di: Jeong, Jongwon, et al.
Pubblicazione: (2026)
di: Jeong, Jongwon, et al.
Pubblicazione: (2026)
Dual Operating Modes of In-Context Learning
di: Lin, Ziqian, et al.
Pubblicazione: (2024)
di: Lin, Ziqian, et al.
Pubblicazione: (2024)
ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning
di: Zeng, Yuchen, et al.
Pubblicazione: (2025)
di: Zeng, Yuchen, et al.
Pubblicazione: (2025)
Soft Task-Aware Routing of Experts for Equivariant Representation Learning
di: Jeon, Jaebyeong, et al.
Pubblicazione: (2025)
di: Jeon, Jaebyeong, et al.
Pubblicazione: (2025)
Can MLLMs Perform Text-to-Image In-Context Learning?
di: Zeng, Yuchen, et al.
Pubblicazione: (2024)
di: Zeng, Yuchen, et al.
Pubblicazione: (2024)
Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions
di: Kwon, Jihoon, et al.
Pubblicazione: (2025)
di: Kwon, Jihoon, et al.
Pubblicazione: (2025)
Fine-tuning a vision-language model for fracture-surface morphology recognition
di: Liu, Quanliang, et al.
Pubblicazione: (2026)
di: Liu, Quanliang, et al.
Pubblicazione: (2026)
VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data
di: Zeng, Thomas, et al.
Pubblicazione: (2025)
di: Zeng, Thomas, et al.
Pubblicazione: (2025)
State-offset Tuning: State-based Parameter-Efficient Fine-Tuning for State Space Models
di: Kang, Wonjun, et al.
Pubblicazione: (2025)
di: Kang, Wonjun, et al.
Pubblicazione: (2025)
Re-Ex: Revising after Explanation Reduces the Factual Errors in LLM Responses
di: Kim, Juyeon, et al.
Pubblicazione: (2024)
di: Kim, Juyeon, et al.
Pubblicazione: (2024)
Distributional Alignment as a Criterion for Designing Task Vectors in In-Context Learning
di: Kwon, Jihoon, et al.
Pubblicazione: (2026)
di: Kwon, Jihoon, et al.
Pubblicazione: (2026)
TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs
di: Lee, Minjae, et al.
Pubblicazione: (2026)
di: Lee, Minjae, et al.
Pubblicazione: (2026)
Buffer-based Gradient Projection for Continual Federated Learning
di: Dai, Shenghong, et al.
Pubblicazione: (2024)
di: Dai, Shenghong, et al.
Pubblicazione: (2024)
Online Conformal Abstention for Factuality Control Under Adversarial Bandit Feedback
di: Lee, Minjae, et al.
Pubblicazione: (2025)
di: Lee, Minjae, et al.
Pubblicazione: (2025)
In-Context Learning with Hypothesis-Class Guidance
di: Lin, Ziqian, et al.
Pubblicazione: (2025)
di: Lin, Ziqian, et al.
Pubblicazione: (2025)
ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs
di: Kang, Wonjun, et al.
Pubblicazione: (2025)
di: Kang, Wonjun, et al.
Pubblicazione: (2025)
Can Separators Improve Chain-of-Thought Prompting?
di: Park, Yoonjeong, et al.
Pubblicazione: (2024)
di: Park, Yoonjeong, et al.
Pubblicazione: (2024)
UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
di: Kang, Wonjun, et al.
Pubblicazione: (2025)
di: Kang, Wonjun, et al.
Pubblicazione: (2025)
Exploration and Exploitation Errors Are Measurable for Language Model Agents
di: Park, Jaden, et al.
Pubblicazione: (2026)
di: Park, Jaden, et al.
Pubblicazione: (2026)
Linq-Embed-Mistral Technical Report
di: Choi, Chanyeol, et al.
Pubblicazione: (2024)
di: Choi, Chanyeol, et al.
Pubblicazione: (2024)
The Expressive Power of Low-Rank Adaptation
di: Zeng, Yuchen, et al.
Pubblicazione: (2023)
di: Zeng, Yuchen, et al.
Pubblicazione: (2023)
Improving Multi-lingual Alignment Through Soft Contrastive Learning
di: Park, Minsu, et al.
Pubblicazione: (2024)
di: Park, Minsu, et al.
Pubblicazione: (2024)
ERD: A Framework for Improving LLM Reasoning for Cognitive Distortion Classification
di: Lim, Sehee, et al.
Pubblicazione: (2024)
di: Lim, Sehee, et al.
Pubblicazione: (2024)
A Generalized Theory of Mixup for Structure-Preserving Synthetic Data
di: Lee, Chungpa, et al.
Pubblicazione: (2025)
di: Lee, Chungpa, et al.
Pubblicazione: (2025)
FinDER: Financial Dataset for Question Answering and Evaluating Retrieval-Augmented Generation
di: Choi, Chanyeol, et al.
Pubblicazione: (2025)
di: Choi, Chanyeol, et al.
Pubblicazione: (2025)
Noise-Adaptive Confidence Sets for Linear Bandits and Application to Bayesian Optimization
di: Jun, Kwang-Sung, et al.
Pubblicazione: (2024)
di: Jun, Kwang-Sung, et al.
Pubblicazione: (2024)
Task Vectors in In-Context Learning: Emergence, Formation, and Benefit
di: Yang, Liu, et al.
Pubblicazione: (2025)
di: Yang, Liu, et al.
Pubblicazione: (2025)
Model Fusion through Bayesian Optimization in Language Model Fine-Tuning
di: Jang, Chaeyun, et al.
Pubblicazione: (2024)
di: Jang, Chaeyun, et al.
Pubblicazione: (2024)
Lipschitz Bandits with Stochastic Delayed Feedback
di: Liu, Zhongxuan, et al.
Pubblicazione: (2025)
di: Liu, Zhongxuan, et al.
Pubblicazione: (2025)
ENTP: Encoder-only Next Token Prediction
di: Ewer, Ethan, et al.
Pubblicazione: (2024)
di: Ewer, Ethan, et al.
Pubblicazione: (2024)
Effective 10‐bit OLED driver IC with 11‐bit DAC, double capacitor‐coupled adder, and offset calibration for enhanced panel driving
di: Changwhan Kim, et al.
Pubblicazione: (2025)
di: Changwhan Kim, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
di: Lee, Chungpa, et al.
Pubblicazione: (2026) -
How to Correctly Report LLM-as-a-Judge Evaluations
di: Lee, Chungpa, et al.
Pubblicazione: (2025) -
Analysis of Using Sigmoid Loss for Contrastive Learning
di: Lee, Chungpa, et al.
Pubblicazione: (2024) -
On the Similarities of Embeddings in Contrastive Learning
di: Lee, Chungpa, et al.
Pubblicazione: (2025) -
A Theoretical Framework for Preventing Class Collapse in Supervised Contrastive Learning
di: Lee, Chungpa, et al.
Pubblicazione: (2025)