Quantization Thresholds Replicate, Failure Modes Do Not: A Three-Model Study of Agentic Tool Use in Polish from 8-bit to 2-bit
cs.CL
Submitted: 2026-09-25
Updated: 2026-09-25
Code: https://github.com/JakubPrejzner/polagentbench
Terminology
Sources
- Resource-Efficient Language Models: Quantization for Fast and Accessible Inference
- Which Quantization Should I Use? A Unified Evaluation of llama.cpp Quantization on Llama-3.1-8B-Instruct
- An empirical study of LLaMA3 quantization: from LLMs to MLLMs
- Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
- How Does Quantization Affect Multilingual LLMs?
- $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
- Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling
- TinyLLM: Evaluation and Optimization of Small Language Models for Agentic Tasks on Edge Devices
- Bielik 7B v0.1: A Polish Language Model -- Development, Insights, and Evaluation
- Bielik 11B v2 Technical Report
- Bielik v3 Small: Technical Report
- Bielik 11B v3: Multilingual Large Language Model for European Languages
- Bielik-Minitron-7B: Compressing Large Language Models via Structured Pruning and Knowledge Distillation for the Polish Language
- Compact Language Models via Pruning and Knowledge Distillation
- PLLuM: A Family of Polish Large Language Models
- Bielik-Q2-Sharp: A Comparative Study of Extreme 2-bit Quantization Methods for a Polish 11B Language Model
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering