UniMaia: Steering Chess Policies with Language for Human-like Play
Fuente:
arXiv
Guardado en:
| Autores principales: | Siu, Sherman, Istead, Lesley |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving Steering Vectors by Targeting Sparse Autoencoder Features
por: Chalnev, Sviatoslav, et al.
Publicado: (2024)
por: Chalnev, Sviatoslav, et al.
Publicado: (2024)
Complete Chess Games Enable LLM Become A Chess Master
por: Zhang, Yinqi, et al.
Publicado: (2025)
por: Zhang, Yinqi, et al.
Publicado: (2025)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Compositional Steering of Large Language Models with Steering Tokens
por: Radevski, Gorjan, et al.
Publicado: (2026)
por: Radevski, Gorjan, et al.
Publicado: (2026)
Bridging the Gap between Expert and Language Models: Concept-guided Chess Commentary Generation and Evaluation
por: Kim, Jaechang, et al.
Publicado: (2024)
por: Kim, Jaechang, et al.
Publicado: (2024)
C-3PO: Compact Plug-and-Play Proxy Optimization to Achieve Human-like Retrieval-Augmented Generation
por: Chen, Guoxin, et al.
Publicado: (2025)
por: Chen, Guoxin, et al.
Publicado: (2025)
Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind
por: Xiao, Hanqi, et al.
Publicado: (2026)
por: Xiao, Hanqi, et al.
Publicado: (2026)
Word Embeddings Are Steers for Language Models
por: Han, Chi, et al.
Publicado: (2023)
por: Han, Chi, et al.
Publicado: (2023)
HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
por: Sharma, Kartik, et al.
Publicado: (2026)
por: Sharma, Kartik, et al.
Publicado: (2026)
Beyond Labels: Aligning Large Language Models with Human-like Reasoning
por: Kabir, Muhammad Rafsan, et al.
Publicado: (2024)
por: Kabir, Muhammad Rafsan, et al.
Publicado: (2024)
Endogenous Resistance to Activation Steering in Language Models
por: McKenzie, Alex, et al.
Publicado: (2026)
por: McKenzie, Alex, et al.
Publicado: (2026)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
por: Weng, Zixuan, et al.
Publicado: (2026)
por: Weng, Zixuan, et al.
Publicado: (2026)
Steering Large Language Models for Machine Translation Personalization
por: Scalena, Daniel, et al.
Publicado: (2025)
por: Scalena, Daniel, et al.
Publicado: (2025)
HyperSteer: Activation Steering at Scale with Hypernetworks
por: Sun, Jiuding, et al.
Publicado: (2025)
por: Sun, Jiuding, et al.
Publicado: (2025)
Steer Like the LLM: Activation Steering that Mimics Prompting
por: Heyman, Geert, et al.
Publicado: (2026)
por: Heyman, Geert, et al.
Publicado: (2026)
Improving Instruction-Following in Language Models through Activation Steering
por: Stolfo, Alessandro, et al.
Publicado: (2024)
por: Stolfo, Alessandro, et al.
Publicado: (2024)
Multi-Attribute Steering of Language Models via Targeted Intervention
por: Nguyen, Duy, et al.
Publicado: (2025)
por: Nguyen, Duy, et al.
Publicado: (2025)
Self-Play Preference Optimization for Language Model Alignment
por: Wu, Yue, et al.
Publicado: (2024)
por: Wu, Yue, et al.
Publicado: (2024)
UniMoT: Unified Molecule-Text Language Model with Discrete Token Representation
por: Guo, Shuhan, et al.
Publicado: (2024)
por: Guo, Shuhan, et al.
Publicado: (2024)
ILRR: Inference-Time Steering Method for Masked Diffusion Language Models
por: Avrahami, Eden, et al.
Publicado: (2026)
por: Avrahami, Eden, et al.
Publicado: (2026)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
por: Anand, Nikhil, et al.
Publicado: (2026)
por: Anand, Nikhil, et al.
Publicado: (2026)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
por: Scalena, Daniel, et al.
Publicado: (2024)
por: Scalena, Daniel, et al.
Publicado: (2024)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
por: Oozeer, Narmeen, et al.
Publicado: (2025)
por: Oozeer, Narmeen, et al.
Publicado: (2025)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
por: Soo, Samuel, et al.
Publicado: (2025)
por: Soo, Samuel, et al.
Publicado: (2025)
HAL: Inducing Human-likeness in LLMs with Alignment
por: Hasan, Masum, et al.
Publicado: (2026)
por: Hasan, Masum, et al.
Publicado: (2026)
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
por: Wong, Sing Hieng, et al.
Publicado: (2026)
por: Wong, Sing Hieng, et al.
Publicado: (2026)
UniSD: Towards a Unified Self-Distillation Framework for Large Language Models
por: Jin, Yiqiao, et al.
Publicado: (2026)
por: Jin, Yiqiao, et al.
Publicado: (2026)
Merging LoRAs like Playing LEGO: Pushing the Modularity of LoRA to Extremes Through Rank-Wise Clustering
por: Zhao, Ziyu, et al.
Publicado: (2024)
por: Zhao, Ziyu, et al.
Publicado: (2024)
What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
por: Cheng, Stephen, et al.
Publicado: (2026)
por: Cheng, Stephen, et al.
Publicado: (2026)
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models
por: Zhou, Hanhan, et al.
Publicado: (2026)
por: Zhou, Hanhan, et al.
Publicado: (2026)
That's Deprecated! Understanding, Detecting, and Steering Knowledge Conflicts in Language Models for Code Generation
por: Bae, Jaesung, et al.
Publicado: (2025)
por: Bae, Jaesung, et al.
Publicado: (2025)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
por: Chen, Zixiang, et al.
Publicado: (2024)
por: Chen, Zixiang, et al.
Publicado: (2024)
Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs
por: Han, Pengrui, et al.
Publicado: (2026)
por: Han, Pengrui, et al.
Publicado: (2026)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
por: Oh, Sejoon, et al.
Publicado: (2024)
por: Oh, Sejoon, et al.
Publicado: (2024)
TextAtari: 100K Frames Game Playing with Language Agents
por: Li, Wenhao, et al.
Publicado: (2025)
por: Li, Wenhao, et al.
Publicado: (2025)
Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations
por: Braun, Joschka
Publicado: (2026)
por: Braun, Joschka
Publicado: (2026)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
por: He, Zirui, et al.
Publicado: (2025)
por: He, Zirui, et al.
Publicado: (2025)
A Nurse is Blue and Elephant is Rugby: Cross Domain Alignment in Large Language Models Reveal Human-like Patterns
por: Yehudai, Asaf, et al.
Publicado: (2024)
por: Yehudai, Asaf, et al.
Publicado: (2024)
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
por: Ji, Xiang, et al.
Publicado: (2024)
por: Ji, Xiang, et al.
Publicado: (2024)
Ejemplares similares
-
Improving Steering Vectors by Targeting Sparse Autoencoder Features
por: Chalnev, Sviatoslav, et al.
Publicado: (2024) -
Complete Chess Games Enable LLM Become A Chess Master
por: Zhang, Yinqi, et al.
Publicado: (2025) -
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
por: Siu, Vincent, et al.
Publicado: (2025) -
Compositional Steering of Large Language Models with Steering Tokens
por: Radevski, Gorjan, et al.
Publicado: (2026) -
Bridging the Gap between Expert and Language Models: Concept-guided Chess Commentary Generation and Evaluation
por: Kim, Jaechang, et al.
Publicado: (2024)