SmolTalk2

← All datasets

Author: Distillio · License: mixed (apache-2.0 + source licenses) · Format: parquet

0 downloads · 0 stars · 0 mirrors · size unknown · 1 file

The 2025 SFT mixture behind SmolLM3: decontaminated multi-task instruction data spanning chat, reasoning, and tool use.

Tags: sft · instruction-tuning · multi-task

Description

2025 SFT mixture used to train SmolLM3 — decontaminated, multi-task instruction data spanning chat, reasoning, and tool use. A mix: HuggingFace's newly-generated subsets are Apache-2.0, but folded-in public datasets (e.g. the Tulu mixture) keep their original licenses.

Download

Direct download: https://huggingface.co/datasets/HuggingFaceTB/smoltalk2/resolve/main/Preference/llama_3.1_tulu_3_8b_preference_mixture_no_think-00000-of-00003.parquet

Or via the API: curl -L -o file "https://huggingface.co/datasets/HuggingFaceTB/smoltalk2/resolve/main/Preference/llama_3.1_tulu_3_8b_preference_mixture_no_think-00000-of-00003.parquet"

Added 2026-08-11. Platform: Distillio — the open source training data collective.