AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?
Fuente:
arXiv
Saved in:
| Main Authors: | Karmakar, Ranit, Chatterjee, Jayita |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models
by: Karmakar, Ranit, et al.
Published: (2026)
by: Karmakar, Ranit, et al.
Published: (2026)
Financial Named Entity Recognition: How Far Can LLM Go?
by: Lu, Yi-Te, et al.
Published: (2025)
by: Lu, Yi-Te, et al.
Published: (2025)
How Far Can In-Context Alignment Go? Exploring the State of In-Context Alignment
by: Huang, Heyan, et al.
Published: (2024)
by: Huang, Heyan, et al.
Published: (2024)
Deceptive Semantic Shortcuts on Reasoning Chains: How Far Can Models Go without Hallucination?
by: Li, Bangzheng, et al.
Published: (2023)
by: Li, Bangzheng, et al.
Published: (2023)
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
by: Lu, Yi, et al.
Published: (2025)
by: Lu, Yi, et al.
Published: (2025)
OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?
by: Chen, Xuetian, et al.
Published: (2025)
by: Chen, Xuetian, et al.
Published: (2025)
RETUYT-INCO at BEA 2025 Shared Task: How Far Can Lightweight Models Go in AI-powered Tutor Evaluation?
by: Góngora, Santiago, et al.
Published: (2025)
by: Góngora, Santiago, et al.
Published: (2025)
Reasoning Up the Instruction Ladder for Controllable Language Models
by: Zheng, Zishuo, et al.
Published: (2025)
by: Zheng, Zishuo, et al.
Published: (2025)
How Small Can You Go? Compact Language Models for On-Device Critical Error Detection in Machine Translation
by: Chopra, Muskaan, et al.
Published: (2025)
by: Chopra, Muskaan, et al.
Published: (2025)
The AI Co-Ethnographer: How Far Can Automation Take Qualitative Research?
by: Retkowski, Fabian, et al.
Published: (2025)
by: Retkowski, Fabian, et al.
Published: (2025)
Large Language Models for Predictive Analysis: How Far Are They?
by: Chen, Qin, et al.
Published: (2025)
by: Chen, Qin, et al.
Published: (2025)
DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
by: Jing, Liqiang, et al.
Published: (2024)
by: Jing, Liqiang, et al.
Published: (2024)
LLMs for Relational Reasoning: How Far are We?
by: Li, Zhiming, et al.
Published: (2024)
by: Li, Zhiming, et al.
Published: (2024)
How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
by: Huang, Jen-tse, et al.
Published: (2024)
by: Huang, Jen-tse, et al.
Published: (2024)
Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows?
by: Cao, Ruisheng, et al.
Published: (2024)
by: Cao, Ruisheng, et al.
Published: (2024)
Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?
by: Sun, Yiyou, et al.
Published: (2025)
by: Sun, Yiyou, et al.
Published: (2025)
CompactQE: Interpretable Translation Quality Estimation via Small Open-Weight LLMs
by: Guttmann, Kamil, et al.
Published: (2026)
by: Guttmann, Kamil, et al.
Published: (2026)
How Far Are We from Optimal Reasoning Efficiency?
by: Gao, Jiaxuan, et al.
Published: (2025)
by: Gao, Jiaxuan, et al.
Published: (2025)
\$OneMillion-Bench: How Far are Language Agents from Human Experts?
by: Yang, Qianyu, et al.
Published: (2026)
by: Yang, Qianyu, et al.
Published: (2026)
Small Language Model Can Self-correct
by: Han, Haixia, et al.
Published: (2024)
by: Han, Haixia, et al.
Published: (2024)
SoftPQ: Robust Instance Segmentation Evaluation via Soft Matching and Tunable Thresholds
by: Karmakar, Ranit, et al.
Published: (2025)
by: Karmakar, Ranit, et al.
Published: (2025)
MotiveBench: How Far Are We From Human-Like Motivational Reasoning in Large Language Models?
by: Yong, Xixian, et al.
Published: (2025)
by: Yong, Xixian, et al.
Published: (2025)
Establishing Task Scaling Laws via Compute-Efficient Model Ladders
by: Bhagia, Akshita, et al.
Published: (2024)
by: Bhagia, Akshita, et al.
Published: (2024)
Importance Weighting Can Help Large Language Models Self-Improve
by: Jiang, Chunyang, et al.
Published: (2024)
by: Jiang, Chunyang, et al.
Published: (2024)
TinyLlama: An Open-Source Small Language Model
by: Zhang, Peiyuan, et al.
Published: (2024)
by: Zhang, Peiyuan, et al.
Published: (2024)
ARE: Scaling Up Agent Environments and Evaluations
by: Froger, Romain, et al.
Published: (2025)
by: Froger, Romain, et al.
Published: (2025)
"What's Up, Doc?": Analyzing How Users Seek Health Information in Large-Scale Conversational AI Datasets
by: Paruchuri, Akshay, et al.
Published: (2025)
by: Paruchuri, Akshay, et al.
Published: (2025)
Are Large Language Models Truly Smarter Than Humans?
by: M, Eshwar Reddy, et al.
Published: (2026)
by: M, Eshwar Reddy, et al.
Published: (2026)
The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs
by: Zhang, Xing, et al.
Published: (2026)
by: Zhang, Xing, et al.
Published: (2026)
Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMs
by: Chatterjee, Sagnik, et al.
Published: (2026)
by: Chatterjee, Sagnik, et al.
Published: (2026)
How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent
by: Jung, Sungwoo, et al.
Published: (2026)
by: Jung, Sungwoo, et al.
Published: (2026)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
by: Wang, Jingyuan, et al.
Published: (2025)
by: Wang, Jingyuan, et al.
Published: (2025)
Offline Training of Language Model Agents with Functions as Learnable Weights
by: Zhang, Shaokun, et al.
Published: (2024)
by: Zhang, Shaokun, et al.
Published: (2024)
Can Small Models Reason About Legal Documents? A Comparative Study
by: Vaddi, Snehit
Published: (2026)
by: Vaddi, Snehit
Published: (2026)
Localizing AI: Evaluating Open-Weight Language Models for Languages of Baltic States
by: Kapočiūtė-Dzikienė, Jurgita, et al.
Published: (2025)
by: Kapočiūtė-Dzikienė, Jurgita, et al.
Published: (2025)
Distilling LLM Agent into Small Models with Retrieval and Code Tools
by: Kang, Minki, et al.
Published: (2025)
by: Kang, Minki, et al.
Published: (2025)
Selecting Language Models for Social Science: Start Small, Start Open, and Validate
by: Stoltz, Dustin S., et al.
Published: (2026)
by: Stoltz, Dustin S., et al.
Published: (2026)
VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?
by: Liu, Junpeng, et al.
Published: (2024)
by: Liu, Junpeng, et al.
Published: (2024)
Enhanced Review Detection and Recognition: A Platform-Agnostic Approach with Application to Online Commerce
by: Karmakar, Priyabrata, et al.
Published: (2024)
by: Karmakar, Priyabrata, et al.
Published: (2024)
CLAG: Adaptive Memory Organization via Agent-Driven Clustering for Small Language Model Agents
by: Roh, Taeyun, et al.
Published: (2026)
by: Roh, Taeyun, et al.
Published: (2026)
Similar Items
-
What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models
by: Karmakar, Ranit, et al.
Published: (2026) -
Financial Named Entity Recognition: How Far Can LLM Go?
by: Lu, Yi-Te, et al.
Published: (2025) -
How Far Can In-Context Alignment Go? Exploring the State of In-Context Alignment
by: Huang, Heyan, et al.
Published: (2024) -
Deceptive Semantic Shortcuts on Reasoning Chains: How Far Can Models Go without Hallucination?
by: Li, Bangzheng, et al.
Published: (2023) -
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
by: Lu, Yi, et al.
Published: (2025)