Mistral Medium 3.1 is an updated version of Mistral Medium 3, which is a high-performance enterprise-grade language model designed to deliver frontier-level capabilities at significantly reduced operational cost. It balances state-of-the-art reasoning and multimodal performance with 8× lower cost compared to traditional large models, making it suitable for scalable deployments across professional and industrial use cases.
The model excels in domains such as coding, STEM reasoning, and enterprise adaptation. It supports hybrid, on-prem, and in-VPC deployments and is optimized for integration into custom workflows. Mistral Medium 3.1 offers competitive accuracy relative to larger models like Claude Sonnet 3.5/3.7, Llama 4 Maverick, and Command R+, while maintaining broad compatibility across cloud environments.
Evaluations
23
across 19 benchmarks
Latency
487ms
Context length
131k
tokens
Cost
$0.40 · $2
input · output per 1M tokens
Key takeaways
Mistral Medium 3.1 is an enterprise-grade, Transformer-based multimodal language model from MistralAI designed for high-performance reasoning in coding, STEM, and general enterprise adaptation, aiming for frontier capabilities at a reduced operational cost.
The model is a proprietary Transformer-based architecture supporting text+image-to-text modality. Specific training details beyond it being proprietary are not provided. The model has 80 parameters and a context length of 131072.
Mistral Medium 3.1 excels in coding, STEM reasoning, and enterprise adaptation, demonstrating strong logical deduction. However, it struggles with nuanced scientific understanding, complex scientific inferences, distinguishing answer choices, and applying memorized definitions to complex situations.
The model achieves 93.94% accuracy on the AI2 Reasoning Challenge - Challenge dataset, correctly answering approximately 85% of challenge-level scientific reasoning multiple-choice questions, demonstrating strong logical deduction.
The model has a 0% success rate on the Berkeley-Function-Calling-v3 (multi_turn_base, FC) dataset, indicating a complete failure in complex multi-turn tool interaction due to consistent provider API errors (Status 422), resulting in extremely negative readability.