Microsoft Phi-3.5 MoE Instruct

Tekst og chatIkke tilgjengelig
av MicrosoftModell-ID: phi-3-5-moe-instruct

Mixture-of-experts Phi-3.5: 42B total / 6.6B active params. 128k context, multilingual.

Status
Ikke tilgjengelig
Kontekst
131 072 tokens
Maks. utdata
4 096 tokens
Input → output
Tekst → Tekst
Utvikler
Microsoft
Oppdatert
25. juni 2026

Microsoft Phi-3.5 MoE Instruct er for øyeblikket utilgjengelig

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert.

Du kan fortsatt lese detaljene på denne siden. Velg ett av de tilgjengelige alternativene nedenfor for å kjøre en sammenlignbar modell med en gang.

Gå til alternativer
01

Sammenlignbare modeller

Alle i denne kategorien
  • Anthropic's model for the most demanding reasoning and long-horizon agentic work. 1M-token context window, up to 128K output tokens, adaptive thinking that is always on.

    12,00 USD/1M inn

  • The most capable model of Anthropic's Opus 4 series. State of the art on long-horizon agentic work, coding and knowledge tasks, with a 1M-token context window at standard pricing.

    6,00 USD/1M inn

  • Anthropic's current Opus model for long-running agentic coding and knowledge work. 1M-token context window, up to 128K output tokens, adaptive thinking that is always on.

    4,80 USD/1M inn

02

Playground

Prøv Microsoft Phi-3.5 MoE Instruct

Chat

Ikke tilgjengelig for øyeblikket

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert.

Lekeplassen er deaktivert. Du finner sammenlignbare modeller i samme kategori: Se alternativer

Prøv Microsoft Phi-3.5 MoE Instruct

Send en melding. Svaret kommer fullstendig når modellen er ferdig (ingen streaming).

Systemprompt
Maks. svarslengde (tokens)

Denne kjøringen

Ingen pris – ikke tilgjengelig for øyeblikket.

Ny her?

5 gratis credits (0,05 USD) når du registrerer deg med Google

Kan brukes 24 timer etter registrering, opptil 5 kjøringer per dag og maksimalt 2 credits per kjøring. Andre påloggingsmetoder starter uten credits.

03

Om Microsoft Phi-3.5 MoE Instruct

Kort sagtPer 25. juni 2026

Microsoft Phi-3.5 MoE Instruct er en modell fra Microsoft i kategorien Tekst og chat. Microsoft Phi-3.5 MoE Instruct er for øyeblikket ikke tilgjengelig på Railwail. Kontekstvinduet inneholder 131 072 tokens, og ett svar kan være opptil 4 096 tokens langt.

Bakgrunn

Om Microsoft Research

Grunnlagt 1991 · Redmond, Washington, USA

Microsoft Research's Machine Learning Foundations group — led by Sébastien Bubeck and Ronen Eldan — drove the Phi series of small-but-capable language models. The Phi thesis is that synthetic 'textbook-quality' training data can produce small models that punch far above their weight on reasoning benchmarks. The series began with Phi-1 (1.3B, code, 2023), Phi-1.5 (general reasoning, 2023), Phi-2 (2.7B, 2023), Phi-3 (Mini, Small, Medium dense models, April 2024) and Phi-3.5 (Mini, Vision, MoE, August 2024). Phi-3.5 MoE was Microsoft's first Mixture-of-Experts Phi variant — 16 experts of 3.8B parameters each with top-2 routing. Microsoft Research itself was founded in 1991 and remains one of the largest industrial AI research organisations in the world; Phi is one of its flagship open-weights AI projects.

Besøk Microsoft Research

Arkitektur

Mixture-of-Experts Decoder Transformer

Phi-3.5 MoE Instruct is a 16x3.8B Mixture-of-Experts decoder transformer — 16 experts each approximately the size of Phi-3-Mini, with top-2 routing yielding 6.6B active parameters out of 41.9B total. The architecture uses 32 layers, 4,096 hidden size, 32-head grouped-query attention with 8 KV heads, RoPE positional embeddings (theta=10000, extended for 128K context), SwiGLU activations, and a 32,064-token Llama-derived BPE tokeniser. Routing uses a sparse mixer with auxiliary loss for expert balancing. The model was pretrained on 4.9 trillion tokens of heavily curated data, with the Phi recipe emphasising synthetic 'textbook-quality' data generated from larger models — explicitly oversampling reasoning-dense content over breadth. Training used 512 H100 GPUs for 23 days. Post-training is supervised fine-tuning plus Direct Preference Optimisation (DPO) with explicit safety post-training. Released August 2024 under MIT license.

Parametere
41.9B total, 6.6B active per token (16 experts of ~3.8B each, top-2 routing)
Kontekst
131 072 tokens

Evner

  • 16-expert MoE — Microsoft's first MoE Phi variant
  • Only 6.6B active parameters — cheap inference for MoE
  • Punches above weight: matches Mixtral 8x7B (12.9B active) and Llama 3.1 8B on many benchmarks
  • Strong math and reasoning for active-param size (MMLU 78.9, GSM8K 88.7)
  • 128K context window
  • Multilingual support for 22 languages
  • Open weights under permissive MIT license
  • Best for: cost-efficient reasoning, on-device inference (INT4 ~12GB), education and tutoring applications.

Trening og lisens

Pretrained on 4.9 trillion tokens. The mix is heavily curated and includes filtered web data, synthetic 'textbook-quality' data generated from larger models, code, math and 22-language multilingual sources. Knowledge cutoff October 2023. Training used 512 NVIDIA H100 GPUs for 23 days. Post-training is supervised fine-tuning plus DPO with explicit safety post-training and red-team feedback.

Lisens: MIT License for the open weights. Commercial use, redistribution and modification permitted without restriction — one of the most permissive licenses among major open-weight LLMs.

Sikkerhetstesting: Microsoft published a model card and Phi-3 technical report with red-team and safety evaluation. Post-training incorporates safety alignment via DPO on red-team feedback.

Kjente begrensninger

  • Total memory ~42B parameters needs ~80GB FP16 — heavier than 6.6B active suggests
  • MoE routing means latency spikes on imbalanced batches
  • Knowledge breadth narrower than larger dense models — Phi trades breadth for reasoning
  • Behind frontier models on coding benchmarks despite strong math
  • Synthetic-data-heavy training can produce 'textbook-like' answers that don't match real-world tone
  • No vision modality (use Phi-3.5-Vision instead)
04

Priser

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert. Det er ingen pris for denne modellen for øyeblikket, så den kan ikke kjøres.

05

API

Ring Microsoft Phi-3.5 MoE Instruct med din Railwail API-nøkkel. Bruk denne modell-IDen i forespørselen:

Ikke tilgjengelig for øyeblikket

Modellen har ingen verifisert pris eller er deaktivert; API-kall blir avvist.

06

Spesifikasjoner

Modell-ID
phi-3-5-moe-instruct
Utvikler
Microsoft
Inndata
Tekst
Utdata
Tekst
Kontekstvindu
131 072 tokens
Maks. utdata
4 096 tokens
Modellstørrelse
41.9B total, 6.6B active per token (16 experts of ~3.8B each, top-2 routing)
Lisens
MIT License for the open weights. Commercial use, redistribution and modification permitted without restriction — one of the most permissive licenses among major open-weight LLMs.
Katalogoppføring oppdatert
25. juni 2026

Merkelapper

  • microsoft
  • open-weights
  • moe
  • multilingual
  • pricing-tbd
07

Brukstilfeller

Hva det brukes til

  • Cost-efficient reasoning at MoE-cheap inference
  • On-device / edge AI (INT4 quantisation ~12GB)
  • Multilingual structured tasks across 22 languages
  • Education and tutoring applications
  • Math and code reasoning in resource-constrained settings
  • Self-hosted small-business assistants
08

Ofte stilte spørsmål

Hva er Microsoft Phi-3.5 MoE Instruct?

Microsoft Phi-3.5 MoE Instruct er en modell fra Microsoft i kategorien Tekst og chat. Den er oppført på Railwail, men kan ikke kjøres for øyeblikket.

Hvor mye koster Microsoft Phi-3.5 MoE Instruct på Railwail?

Microsoft Phi-3.5 MoE Instruct kan ikke kjøres på Railwail for øyeblikket, så det finnes ingen gjeldende pris. Tilgjengelige alternativer med priser er oppført lenger ned på denne siden.

Hvor stort er kontekstvinduet til Microsoft Phi-3.5 MoE Instruct?

Kontekstvinduet til Microsoft Phi-3.5 MoE Instruct inneholder 131 072 tokens. Ett svar kan være opptil 4 096 tokens langt.

Hvor rask er Microsoft Phi-3.5 MoE Instruct?

Det finnes ennå ikke nok målte kjøringer av Microsoft Phi-3.5 MoE Instruct på Railwail til å angi en kjøretid. Det avhenger av inndataene, innstillingene og belastningen hos leverandøren.

Er Microsoft Phi-3.5 MoE Instruct bedre enn Claude Fable 5.1?

Det avhenger av oppgaven. Microsoft Phi-3.5 MoE Instruct (Microsoft) og Claude Fable 5.1 (Anthropic) er begge modeller i kategorien Tekst og chat. Sammenligningssiden viser prisene og spesifikasjonene deres side ved side.

Sammenlign Microsoft Phi-3.5 MoE Instruct og Claude Fable 5.1

Kan jeg bruke Microsoft Phi-3.5 MoE Instruct akkurat nå?

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert. Siden forblir online; tilgjengelige alternativer fra samme kategori er oppført lenger ned.

Alle modeller gjennom én API

Én API-nøkkel for alle modeller på Railwail. Bruk belastes fra forhåndsbetalt kreditt, 1 kreditt = 0,01 USD.