Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
Phi is a family of small language models introduced by Microsoft Research in June 2023. Its emphasis is data quality rather than model size: training on filtered “textbook-quality” text lets a few-billion-parameter model approach much larger ones on reasoning and coding. Phi-3 offers 3.8B, 7B and 14B sizes, and the smallest, Phi-3-mini, can run on-device. The models are released as open weights and are often used to probe the capability limits of small models.
Почему стоит запомнить
It showed that curating and orchestrating data can substitute for parameter count to a surprising degree: a few-billion-parameter model trained on selected data can approach models an order of magnitude larger on some reasoning tasks.
Ключевые характеристики
- Parameters
- 3.8B / 7B / 14B (Phi-3 family)
- Training data
- Mainly filtered “textbook-quality” text
- Open weights
- Yes
- Released
- 2023-06
Возможности
Связанные концепции
Предобучение и дообучение
Сначала выучить язык на огромных неразмеченных корпусах, затем специализироваться на малых данных — самый экономный по данным подход в современном ИИ
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге
Сжатие моделей
Сделать модель меньше, быстрее и дешевле почти без потери точности — но три сразу удаётся редко
Аналоги
Llama
2023Семейство моделей, сделавшее открытые веса массовым путём
Mistral Large
2024Флагманская коммерческая модель европейской лаборатории открытых весов
Qwen
2023Семейство с открытыми весами, охватывающее разные размеры и мультимодальные версии