FLRT: Fluent Student-Teacher Redteaming
Fuente:
arXiv
Guardado en:
| Autores principales: | Thompson, T. Ben, Sklar, Michael |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Fluent dreaming for language models
por: Thompson, T. Ben, et al.
Publicado: (2024)
por: Thompson, T. Ben, et al.
Publicado: (2024)
Fluent but Unfeeling: The Emotional Blind Spots of Language Models
por: Shu, Bangzhao, et al.
Publicado: (2025)
por: Shu, Bangzhao, et al.
Publicado: (2025)
AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations
por: Dingeto, Hiskias, et al.
Publicado: (2026)
por: Dingeto, Hiskias, et al.
Publicado: (2026)
Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages
por: Samuel, David, et al.
Publicado: (2025)
por: Samuel, David, et al.
Publicado: (2025)
LIME-LLM: Probing Models with Fluent Counterfactuals, Not Broken Text
por: Mihaila, George, et al.
Publicado: (2026)
por: Mihaila, George, et al.
Publicado: (2026)
Fluent but Foreign: Even Regional LLMs Lack Cultural Alignment
por: Agarwal, Dhruv, et al.
Publicado: (2025)
por: Agarwal, Dhruv, et al.
Publicado: (2025)
HyperSteer: Activation Steering at Scale with Hypernetworks
por: Sun, Jiuding, et al.
Publicado: (2025)
por: Sun, Jiuding, et al.
Publicado: (2025)
Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling
por: Xu, Wenda, et al.
Publicado: (2024)
por: Xu, Wenda, et al.
Publicado: (2024)
The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection
por: Hu, Zhengyu, et al.
Publicado: (2026)
por: Hu, Zhengyu, et al.
Publicado: (2026)
Improving the Robustness of Distantly-Supervised Named Entity Recognition via Uncertainty-Aware Teacher Learning and Student-Student Collaborative Learning
por: Si, Shuzheng, et al.
Publicado: (2023)
por: Si, Shuzheng, et al.
Publicado: (2023)
HyperDAS: Towards Automating Mechanistic Interpretability with Hypernetworks
por: Sun, Jiuding, et al.
Publicado: (2025)
por: Sun, Jiuding, et al.
Publicado: (2025)
Instruction Multi-Constraint Molecular Generation Using a Teacher-Student Large Language Model
por: Zhou, Peng, et al.
Publicado: (2024)
por: Zhou, Peng, et al.
Publicado: (2024)
Boosting Scientific Concepts Understanding: Can Analogy from Teacher Models Empower Student Models?
por: Yuan, Siyu, et al.
Publicado: (2024)
por: Yuan, Siyu, et al.
Publicado: (2024)
YODA: Teacher-Student Progressive Learning for Language Models
por: Lu, Jianqiao, et al.
Publicado: (2024)
por: Lu, Jianqiao, et al.
Publicado: (2024)
Hidding the Ghostwriters: An Adversarial Evaluation of AI-Generated Student Essay Detection
por: Peng, Xinlin, et al.
Publicado: (2024)
por: Peng, Xinlin, et al.
Publicado: (2024)
Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation
por: Liu, Yanjiang, et al.
Publicado: (2026)
por: Liu, Yanjiang, et al.
Publicado: (2026)
Decoding with Limited Teacher Supervision Requires Understanding When to Trust the Teacher
por: Ok, Hyunjong, et al.
Publicado: (2024)
por: Ok, Hyunjong, et al.
Publicado: (2024)
DataEnvGym: Data Generation Agents in Teacher Environments with Student Feedback
por: Khan, Zaid, et al.
Publicado: (2024)
por: Khan, Zaid, et al.
Publicado: (2024)
Towards Goal-Oriented Agents for Evolving Problems Observed via Conversation
por: Free, Michael, et al.
Publicado: (2024)
por: Free, Michael, et al.
Publicado: (2024)
Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning
por: Seo, Yeongbin, et al.
Publicado: (2025)
por: Seo, Yeongbin, et al.
Publicado: (2025)
Technical Report: Impact of Position Bias on Language Models in Token Classification
por: Amor, Mehdi Ben, et al.
Publicado: (2023)
por: Amor, Mehdi Ben, et al.
Publicado: (2023)
Stronger Models are NOT Stronger Teachers for Instruction Tuning
por: Xu, Zhangchen, et al.
Publicado: (2024)
por: Xu, Zhangchen, et al.
Publicado: (2024)
Learning the Latent Rules of a Game from Data: A Chess Story
por: Fauber, Ben
Publicado: (2024)
por: Fauber, Ben
Publicado: (2024)
Some Issues in Predictive Ethics Modeling: An Annotated Contrast Set of "Moral Stories"
por: Fitzgerald, Ben
Publicado: (2024)
por: Fitzgerald, Ben
Publicado: (2024)
Large Language Models for In-Context Student Modeling: Synthesizing Student's Behavior in Visual Programming
por: Nguyen, Manh Hung, et al.
Publicado: (2023)
por: Nguyen, Manh Hung, et al.
Publicado: (2023)
Rethinking Data Synthesis: A Teacher Model Training Recipe with Interpretation
por: Chen, Yifang, et al.
Publicado: (2024)
por: Chen, Yifang, et al.
Publicado: (2024)
Overcoming Vocabulary Mismatch: Vocabulary-agnostic Teacher Guided Language Modeling
por: Shin, Haebin, et al.
Publicado: (2025)
por: Shin, Haebin, et al.
Publicado: (2025)
Reliability Gated Multi-Teacher Distillation for Low Resource Abstractive Summarization
por: Sumit, Dipto, et al.
Publicado: (2026)
por: Sumit, Dipto, et al.
Publicado: (2026)
Do Students Debias Like Teachers? On the Distillability of Bias Mitigation Methods
por: Cheng, Jiali, et al.
Publicado: (2025)
por: Cheng, Jiali, et al.
Publicado: (2025)
Fabricator: An Open Source Toolkit for Generating Labeled Training Data with Teacher LLMs
por: Golde, Jonas, et al.
Publicado: (2023)
por: Golde, Jonas, et al.
Publicado: (2023)
SCOPE: Language Models as One-Time Teacher for Hierarchical Planning in Text Environments
por: Lu, Haoye, et al.
Publicado: (2025)
por: Lu, Haoye, et al.
Publicado: (2025)
RL from Teacher-Model Refinement: Gradual Imitation Learning for Machine Translation
por: Lee, Dongyub Jude, et al.
Publicado: (2025)
por: Lee, Dongyub Jude, et al.
Publicado: (2025)
Improving Statistical Significance in Human Evaluation of Automatic Metrics via Soft Pairwise Accuracy
por: Thompson, Brian, et al.
Publicado: (2024)
por: Thompson, Brian, et al.
Publicado: (2024)
Surfacing Isolated Learners with Outcome-Independent Mediation of Feedback between Teachers and Students Using AI
por: Park, Junsoo, et al.
Publicado: (2026)
por: Park, Junsoo, et al.
Publicado: (2026)
Learning from Committee: Reasoning Distillation from a Mixture of Teachers with Peer-Review
por: Li, Zhuochun, et al.
Publicado: (2024)
por: Li, Zhuochun, et al.
Publicado: (2024)
Table-Filling via Mean Teacher for Cross-domain Aspect Sentiment Triplet Extraction
por: Peng, Kun, et al.
Publicado: (2024)
por: Peng, Kun, et al.
Publicado: (2024)
TeacherLM: Teaching to Fish Rather Than Giving the Fish, Language Modeling Likewise
por: He, Nan, et al.
Publicado: (2023)
por: He, Nan, et al.
Publicado: (2023)
How Teachers Can Use Large Language Models and Bloom's Taxonomy to Create Educational Quizzes
por: Elkins, Sabina, et al.
Publicado: (2024)
por: Elkins, Sabina, et al.
Publicado: (2024)
Explainable Collaborative Problem Solving Diagnosis with BERT using SHAP and its Implications for Teacher Adoption
por: Wong, Kester, et al.
Publicado: (2025)
por: Wong, Kester, et al.
Publicado: (2025)
Automatic Reflection Level Classification in Hungarian Student Essays
por: Csibi, Zsolt, et al.
Publicado: (2026)
por: Csibi, Zsolt, et al.
Publicado: (2026)
Ejemplares similares
-
Fluent dreaming for language models
por: Thompson, T. Ben, et al.
Publicado: (2024) -
Fluent but Unfeeling: The Emotional Blind Spots of Language Models
por: Shu, Bangzhao, et al.
Publicado: (2025) -
AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations
por: Dingeto, Hiskias, et al.
Publicado: (2026) -
Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages
por: Samuel, David, et al.
Publicado: (2025) -
LIME-LLM: Probing Models with Fluent Counterfactuals, Not Broken Text
por: Mihaila, George, et al.
Publicado: (2026)