Phi-3.5 Vision
phi-3-5-visionMicrosoft Phi-3.5 Vision Instruct. Small (4.2B) multimodal model with strong document, OCR and multi-image reasoning at low cost.
- Estado
- No disponible
- Contexto
- 131,072 tokens
- Salida máxima
- 4,096 tokens
- Entrada → Salida
- Texto + Imagen → Texto
- Desarrollador
- Microsoft
- Actualizado
- 25 de junio de 2026
Phi-3.5 Vision no está disponible en este momento
Actualmente no disponible: este modelo ha sido desactivado.
Puedes seguir leyendo los detalles en esta página. Elige una de las alternativas disponibles abajo para ejecutar un modelo comparable de inmediato.
Ir a alternativasModelos comparables
Todos en esta categoría- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
≈ USD 0.00030/ejecución
- Claude Opus 4.7Anthropic
Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.
USD 6.00/1M entrada
- Claude Sonnet 4.6Anthropic
Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.
USD 3.60/1M entrada
Playground
Probar Phi-3.5 Vision
Sin formulario de entrada
Actualmente no disponible: este modelo ha sido desactivado.
El área de pruebas está desactivada. Encuentra modelos comparables en la misma categoría: Explorar alternativas
Acerca de Phi-3.5 Vision
Phi-3.5 Vision es un modelo de Microsoft en la categoría Multimodal. Phi-3.5 Vision no está disponible en Railwail en este momento. La ventana de contexto contiene 131,072 tokens, y una respuesta puede tener hasta 4,096 tokens.
Precios
Actualmente no disponible: este modelo ha sido desactivado. No hay precio para este modelo en este momento, por lo que no se puede ejecutar.
API
Sin ejemplo de API verificado
La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.
Especificaciones
- ID del modelo
phi-3-5-vision- Desarrollador
- Microsoft
- Categoría
- Multimodal
- Entrada
- Texto, Imagen
- Salida
- Texto
- Ventana de contexto
- 131,072 tokens
- Salida máxima
- 4,096 tokens
- Entrada del catálogo actualizada
- 25 de junio de 2026
Etiquetas
- replicate
- multimodal
- vision-understanding
- microsoft
- open-weights
- small
Preguntas frecuentes
¿Qué es Phi-3.5 Vision?
Phi-3.5 Vision es un modelo de Microsoft en la categoría Multimodal. Está listado en Railwail pero no se puede ejecutar en este momento.
¿Cuánto cuesta Phi-3.5 Vision en Railwail?
Phi-3.5 Vision no se puede ejecutar en Railwail en este momento, por lo que no hay precio actual. Las alternativas disponibles con precios se enumeran más abajo en esta página.
¿Cuál es la ventana de contexto de Phi-3.5 Vision?
La ventana de contexto de Phi-3.5 Vision contiene 131,072 tokens. Una respuesta puede tener hasta 4,096 tokens.
¿Qué tan rápido es Phi-3.5 Vision?
Aún no hay suficientes ejecuciones medidas de Phi-3.5 Vision en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.
¿Es Phi-3.5 Vision mejor que BLIP?
Eso depende de la tarea. Phi-3.5 Vision (Microsoft) y BLIP (Salesforce) son ambos modelos en la categoría Multimodal. La página de comparación muestra sus precios y especificaciones lado a lado.
Comparar Phi-3.5 Vision y BLIP¿Puede Phi-3.5 Vision procesar imágenes?
Sí. Phi-3.5 Vision acepta imágenes como entrada además de texto.
¿Puedo usar Phi-3.5 Vision ahora mismo?
Actualmente no disponible: este modelo ha sido desactivado. La página permanece en línea; las alternativas disponibles de la misma categoría se enumeran más abajo.
Todos los modelos a través de una API
Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.