Llama 3.2 90B Vision (multimodal)

MultimodalNo disponible
de MetaID del modelo: llama-3-2-90b-vision-mm

Meta's flagship vision-language model. 90B parameters, image understanding + chat, strong VQA performance.

Estado
No disponible
Contexto
131,072 tokens
Salida máxima
8,192 tokens
Entrada → Salida
Texto + Imagen → Texto
Desarrollador
Meta
Actualizado
25 de junio de 2026

Llama 3.2 90B Vision (multimodal) no está disponible en este momento

Actualmente no disponible: este modelo ha sido desactivado.

Puedes seguir leyendo los detalles en esta página. Elige una de las alternativas disponibles abajo para ejecutar un modelo comparable de inmediato.

Ir a alternativas
01

Modelos comparables

Todos en esta categoría
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ USD 0.00030/ejecución

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    USD 6.00/1M entrada

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    USD 3.60/1M entrada

02

Playground

Probar Llama 3.2 90B Vision (multimodal)

Chat

No disponible actualmente

Actualmente no disponible: este modelo ha sido desactivado.

El área de pruebas está desactivada. Encuentra modelos comparables en la misma categoría: Explorar alternativas

Probar Llama 3.2 90B Vision (multimodal)

Envía un mensaje. La respuesta llega completa cuando el modelo termina (sin transmisión en tiempo real).

Indicación del sistema
Longitud máxima de respuesta (tokens)

Esta ejecución

Sin precio – actualmente no disponible.

¿Nuevo aquí?

5 créditos gratis (USD 0.05) cuando te registras con Google

Utilizable 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos.

03

Acerca de Llama 3.2 90B Vision (multimodal)

ResumenA partir de 25 de junio de 2026

Llama 3.2 90B Vision (multimodal) es un modelo de Meta en la categoría Multimodal. Llama 3.2 90B Vision (multimodal) no está disponible en Railwail en este momento. La ventana de contexto contiene 131,072 tokens, y una respuesta puede tener hasta 8,192 tokens.

Fondo

Acerca de Meta AI (FAIR)

Fundado en 2013 · Menlo Park, California, USA

Meta AI is the research arm of Meta Platforms, established in 2013 as Facebook AI Research (FAIR) by Yann LeCun. FAIR has open-sourced many foundational models including PyTorch, RoBERTa, DETR, SAM and the LLaMA family. LLaMA 1 was released in February 2023, LLaMA 2 in July 2023, LLaMA 3 in April 2024 and LLaMA 3.1 (405B) in July 2024. Llama 3.2 launched in September 2024 at Meta Connect, introducing the first multimodal models in the LLaMA family (vision-enabled 11B and 90B) together with tiny on-device text-only siblings (1B, 3B). All Llama 3.2 vision weights are released under the Llama 3 Community Licence and are widely used by enterprise customers via Meta's partner ecosystem (Hugging Face, AWS Bedrock, Azure AI Studio, Google Vertex, Together AI, Groq, Fireworks).

Visitar Meta AI (FAIR)

Arquitectura

Decoder-only Transformer with cross-attended vision encoder

Llama 3.2 90B Vision combines the 70B-parameter Llama 3.1 text backbone (extended to 90B with vision components) and a Vision Transformer image encoder integrated via cross-attention adapter layers, similar in spirit to Flamingo but reusing the LLaMA architecture. The vision tower processes each image to a sequence of visual tokens which are injected into specific cross-attention layers of the LLM decoder while the original text-only weights remain frozen during the multimodal training stage, preserving text-only performance. Pretraining used 6B image-text pairs followed by multi-stage supervised fine-tuning and Direct Preference Optimisation (DPO) on a curated set of image instructions, math and chart data. The model supports a 128K context window and accepts up to 1120x1120 image inputs natively (with tiling for larger images). It does not support video or audio. Llama 3.2 90B Vision is released under the Llama 3 Community Licence (free for commercial use under 700M MAU).

Parámetros
90B
Contexto
128,000 tokens

Capacidades

  • Open-weights 90B vision-language model under Llama 3 Community Licence
  • 128K token context window
  • Image input up to 1120x1120 with tiling for larger images
  • Chart, diagram, OCR and document understanding
  • Strong on MMMU, MathVista, ChartQA and DocVQA among open-weights models
  • Multilingual: English, German, French, Italian, Portuguese, Spanish, Hindi, Thai
  • Tool use and JSON output via Llama 3.1 alignment recipe
  • Best for: open-weights multimodal apps, on-premise document AI, indie research

Entrenamiento y licencia

Pretrained on 6B image-text pairs from public web and licensed sources; supervised fine-tuning and DPO on curated multimodal instruction data. Text knowledge inherited from Llama 3.1 (15T tokens).

Licencia: Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.

Pruebas de seguridad: Meta publishes a comprehensive model card with red-team findings on CBRN, child-safety and hate-speech vectors, plus Llama Guard 3 and Prompt Guard 2 companion models for production safety.

Limitaciones conocidas

  • No video or audio input
  • Latency and cost dominated by 90B params; requires multi-GPU serving
  • Licence restricts the largest hyperscaler use cases
  • Vision quality below GPT-4o and Claude 3.5 Sonnet on hardest charts
  • English-centric in vision domain
04

Precios

Actualmente no disponible: este modelo ha sido desactivado. No hay precio para este modelo en este momento, por lo que no se puede ejecutar.

05

API

Llama a Llama 3.2 90B Vision (multimodal) con tu clave de API de Railwail. Usa este ID de modelo en la solicitud:

Actualmente no disponible

El modelo no tiene un precio verificado o está desactivado; las llamadas a la API se rechazan.

06

Especificaciones

ID del modelo
llama-3-2-90b-vision-mm
Desarrollador
Meta
Categoría
Multimodal
Entrada
Texto, Imagen
Salida
Texto
Ventana de contexto
131,072 tokens
Salida máxima
8,192 tokens
Tamaño del modelo
90B
Licencia
Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.
Entrada del catálogo actualizada
25 de junio de 2026

Etiquetas

  • meta
  • llama
  • multimodal
  • vision
  • open-weights
07

Casos de uso

Para qué se utiliza

  • Open-weights document AI and OCR pipelines
  • On-premise vision-language assistants
  • Chart and diagram understanding for analytics
  • Compliance and regulated-industry multimodal apps
  • Research baselines for vision-language models
08

Preguntas frecuentes

¿Qué es Llama 3.2 90B Vision (multimodal)?

Llama 3.2 90B Vision (multimodal) es un modelo de Meta en la categoría Multimodal. Está listado en Railwail pero no se puede ejecutar en este momento.

¿Cuánto cuesta Llama 3.2 90B Vision (multimodal) en Railwail?

Llama 3.2 90B Vision (multimodal) no se puede ejecutar en Railwail en este momento, por lo que no hay precio actual. Las alternativas disponibles con precios se enumeran más abajo en esta página.

¿Cuál es la ventana de contexto de Llama 3.2 90B Vision (multimodal)?

La ventana de contexto de Llama 3.2 90B Vision (multimodal) contiene 131,072 tokens. Una respuesta puede tener hasta 8,192 tokens.

¿Qué tan rápido es Llama 3.2 90B Vision (multimodal)?

Aún no hay suficientes ejecuciones medidas de Llama 3.2 90B Vision (multimodal) en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es Llama 3.2 90B Vision (multimodal) mejor que BLIP?

Eso depende de la tarea. Llama 3.2 90B Vision (multimodal) (Meta) y BLIP (Salesforce) son ambos modelos en la categoría Multimodal. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar Llama 3.2 90B Vision (multimodal) y BLIP

¿Puede Llama 3.2 90B Vision (multimodal) procesar imágenes?

Sí. Llama 3.2 90B Vision (multimodal) acepta imágenes como entrada además de texto.

¿Puedo usar Llama 3.2 90B Vision (multimodal) ahora mismo?

Actualmente no disponible: este modelo ha sido desactivado. La página permanece en línea; las alternativas disponibles de la misma categoría se enumeran más abajo.

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.