SOMA: Efficient Multi-turn LLM Serving via Small Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Cheng, Xueqi, Wu, Qiong, Zhou, Zhengyi, Zhou, Xugui, Derr, Tyler, Dong, Yushun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ReAD: Reinforcement-Guided Capability Distillation for Large Language Models
by: Cheng, Xueqi, et al.
Published: (2026)
by: Cheng, Xueqi, et al.
Published: (2026)
LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?
by: Cheng, Xueqi, et al.
Published: (2026)
by: Cheng, Xueqi, et al.
Published: (2026)
Think Before You Speak: Cultivating Communication Skills of Large Language Models via Inner Monologue
by: Zhou, Junkai, et al.
Published: (2023)
by: Zhou, Junkai, et al.
Published: (2023)
Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest
by: Davoudi, Ramtin, et al.
Published: (2026)
by: Davoudi, Ramtin, et al.
Published: (2026)
Knowledge Graph-Enhanced Large Language Models via Path Selection
by: Liu, Haochen, et al.
Published: (2024)
by: Liu, Haochen, et al.
Published: (2024)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
by: Zhou, Zhenhong, et al.
Published: (2024)
by: Zhou, Zhenhong, et al.
Published: (2024)
Towards Trustworthy Knowledge Graph Reasoning: An Uncertainty Aware Perspective
by: Ni, Bo, et al.
Published: (2024)
by: Ni, Bo, et al.
Published: (2024)
SafeMT: Multi-turn Safety for Multimodal Language Models
by: Zhu, Han, et al.
Published: (2025)
by: Zhu, Han, et al.
Published: (2025)
Asymmetric Actor-Critic for Multi-turn LLM Agents
by: Jiang, Shuli, et al.
Published: (2026)
by: Jiang, Shuli, et al.
Published: (2026)
Fact-Checking with Large Language Models via Probabilistic Certainty and Consistency
by: Wang, Haoran, et al.
Published: (2026)
by: Wang, Haoran, et al.
Published: (2026)
Small Language Model Helps Resolve Semantic Ambiguity of LLM Prompt
by: Huang, Zhenzhen, et al.
Published: (2026)
by: Huang, Zhenzhen, et al.
Published: (2026)
Towards Trustworthy Retrieval Augmented Generation for Large Language Models: A Survey
by: Ni, Bo, et al.
Published: (2025)
by: Ni, Bo, et al.
Published: (2025)
TurnWise: The Gap between Single- and Multi-turn Language Model Capabilities
by: Graf, Victoria, et al.
Published: (2026)
by: Graf, Victoria, et al.
Published: (2026)
MindEval: Benchmarking Language Models on Multi-turn Mental Health Support
by: Pombal, José, et al.
Published: (2025)
by: Pombal, José, et al.
Published: (2025)
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
by: Abdulhai, Marwa, et al.
Published: (2025)
by: Abdulhai, Marwa, et al.
Published: (2025)
Token Statistics Reveal Conversational Drift in Multi-turn LLM Interaction
by: Hafez, Wael, et al.
Published: (2026)
by: Hafez, Wael, et al.
Published: (2026)
REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM
by: Jindal, Madhur, et al.
Published: (2025)
by: Jindal, Madhur, et al.
Published: (2025)
UNLEARN Efficient Removal of Knowledge in Large Language Models
by: Lizzo, Tyler, et al.
Published: (2024)
by: Lizzo, Tyler, et al.
Published: (2024)
Could Small Language Models Serve as Recommenders? Towards Data-centric Cold-start Recommendations
by: Wu, Xuansheng, et al.
Published: (2023)
by: Wu, Xuansheng, et al.
Published: (2023)
Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
by: Wang, Hao, et al.
Published: (2026)
by: Wang, Hao, et al.
Published: (2026)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
by: Zhou, Zhanhui, et al.
Published: (2024)
by: Zhou, Zhanhui, et al.
Published: (2024)
AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents
by: Ma, Chang, et al.
Published: (2024)
by: Ma, Chang, et al.
Published: (2024)
A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems
by: Yi, Zihao, et al.
Published: (2024)
by: Yi, Zihao, et al.
Published: (2024)
KG-CF: Knowledge Graph Completion with Context Filtering under the Guidance of Large Language Models
by: Zheng, Zaiyi, et al.
Published: (2025)
by: Zheng, Zaiyi, et al.
Published: (2025)
From LLM-anation to LLM-orchestrator: Coordinating Small Models for Data Labeling
by: Lu, Yao, et al.
Published: (2025)
by: Lu, Yao, et al.
Published: (2025)
Improving Contextual ASR via Multi-grained Fusion with Large Language Models
by: Zhou, Shilin, et al.
Published: (2025)
by: Zhou, Shilin, et al.
Published: (2025)
M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs
by: Ha, Junwoo, et al.
Published: (2025)
by: Ha, Junwoo, et al.
Published: (2025)
A State-Update Prompting Strategy for Efficient and Robust Multi-turn Dialogue
by: Liu, Ziyi
Published: (2025)
by: Liu, Ziyi
Published: (2025)
Holistic Automated Red Teaming for Large Language Models through Top-Down Test Case Generation and Multi-turn Interaction
by: Zhang, Jinchuan, et al.
Published: (2024)
by: Zhang, Jinchuan, et al.
Published: (2024)
LoopServe: An Adaptive Dual-phase LLM Inference Acceleration System for Multi-Turn Dialogues
by: Li, Haoyang, et al.
Published: (2025)
by: Li, Haoyang, et al.
Published: (2025)
Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspective
by: Wen, Yuchen, et al.
Published: (2024)
by: Wen, Yuchen, et al.
Published: (2024)
GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication
by: Tang, Hua, et al.
Published: (2025)
by: Tang, Hua, et al.
Published: (2025)
Broaden your SCOPE! Efficient Multi-turn Conversation Planning for LLMs with Semantic Space
by: Chen, Zhiliang, et al.
Published: (2025)
by: Chen, Zhiliang, et al.
Published: (2025)
InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning
by: Xie, Congkai, et al.
Published: (2025)
by: Xie, Congkai, et al.
Published: (2025)
EfficientLLM: Efficiency in Large Language Models
by: Yuan, Zhengqing, et al.
Published: (2025)
by: Yuan, Zhengqing, et al.
Published: (2025)
Unsupervised Information Refinement Training of Large Language Models for Retrieval-Augmented Generation
by: Xu, Shicheng, et al.
Published: (2024)
by: Xu, Shicheng, et al.
Published: (2024)
Coral: Cost-Efficient Multi-LLM Serving over Heterogeneous Cloud GPUs
by: Mei, Yixuan, et al.
Published: (2026)
by: Mei, Yixuan, et al.
Published: (2026)
Adaptive Stopping for Multi-Turn LLM Reasoning
by: Zhou, Xiaofan, et al.
Published: (2026)
by: Zhou, Xiaofan, et al.
Published: (2026)
Revision or Re-Solving? Decomposing Second-Pass Gains in Multi-LLM Pipelines
by: Ning, Jingjie, et al.
Published: (2026)
by: Ning, Jingjie, et al.
Published: (2026)
HintMR: Eliciting Stronger Mathematical Reasoning in Small Language Models
by: Hossain, Jawad, et al.
Published: (2026)
by: Hossain, Jawad, et al.
Published: (2026)
Similar Items
-
ReAD: Reinforcement-Guided Capability Distillation for Large Language Models
by: Cheng, Xueqi, et al.
Published: (2026) -
LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?
by: Cheng, Xueqi, et al.
Published: (2026) -
Think Before You Speak: Cultivating Communication Skills of Large Language Models via Inner Monologue
by: Zhou, Junkai, et al.
Published: (2023) -
Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest
by: Davoudi, Ramtin, et al.
Published: (2026) -
Knowledge Graph-Enhanced Large Language Models via Path Selection
by: Liu, Haochen, et al.
Published: (2024)