Moondream2
moondream2Moondream2 small vision-language model on Replicate. About 1.9B params, designed to run on edge devices, handles captioning, visual QA and short OCR-style reads at very low cost.
- Precio
- ≈ USD 0.0020/ejecución
- Entrada → Salida
- Texto + Imagen → Texto
- Desarrollador
- Community
- Actualizado
- 23 de septiembre de 2026
Playground
Probar Moondream2
Entrada y salida
Esta ejecución
aprox. USD 0.002 · 0.2 créditos
Se reservan USD 0.0058 (0.58 créditos) al inicio; se factura el tiempo real de GPU.
¿Nuevo aquí?
10 créditos gratis (USD 0.10) cuando te registras con Google
Utilizable 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos. Suficiente para 17 ejecuciones de este modelo.
Examples
InputPrompt
Describe this image
Response
The image features a logo with a smiling blue circle above the word "moondream" written in black text.
InputPrompt
Describe this image
Response
A man with a beard and mustache, wearing a suit and red tie, is smiling at the camera with a blue background featuring a logo.
InputPrompt
Describe this image
Response
An astronaut in a white spacesuit is riding a unicorn with a rainbow mane and tail, soaring through a colorful, dreamlike sky with clouds and rainbows.
Acerca de Moondream2
Moondream2 es un modelo de Community en la categoría Multimodal. En Railwail, Moondream2 cuesta ≈ USD 0.0020 por ejecución.
Precios
| Ejecución típica (≈ 2 s en L40S) | USD 0.0020 por ejecución |
|---|---|
| Tiempo de GPU (L40S) | USD 0.00117 por segundo de GPU |
- Se factura por el tiempo de GPU que realmente toma la ejecución. Cuando comienza la ejecución, se reserva 3× el precio típico de tu saldo y se liquida después.
- 1 crédito = USD 0.01
Calculadora de costos
Calculadora de precios
Típico según el proveedor: aprox. 1.6 s
Total
USD 0.20
20 créditos
Por ejecución
USD 0.002 · 0.2 créditos
Se factura el tiempo real de GPU; este es un estimado.
API
Sin ejemplo de API verificado
La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.
Especificaciones
- ID del modelo
moondream2- Desarrollador
- Community
- Categoría
- Multimodal
- Entrada
- Texto, Imagen
- Salida
- Texto
- Facturación
- Por uso (tokens o tiempo de GPU)
- Entrada del catálogo actualizada
- 23 de septiembre de 2026
Parámetros de entrada
Entradas y configuraciones del esquema de entrada del modelo. El ejemplo en la sección API muestra cuáles de ellas acepta la API.
promptrequeridoQuestion about the image
Tipo: TextoPredeterminado: –Valores permitidos: hasta 8,000 caracteresimage_urlImage URL to analyze
Tipo: TextoPredeterminado: –Valores permitidos: –
Etiquetas
- replicate
- moondream
- vision-understanding
- open-source
- small
- edge
Preguntas frecuentes
¿Qué es Moondream2?
Moondream2 es un modelo de Community en la categoría Multimodal.
¿Cuánto cuesta Moondream2 en Railwail?
En Railwail, Moondream2 cuesta ≈ USD 0.0020 por ejecución. Se te cobra por lo que cada solicitud realmente usa. El uso se paga con créditos prepagados; 1 crédito equivale a USD 0.01.
¿Qué configuraciones admite Moondream2?
Según su esquema de entrada, Moondream2 conoce estos parámetros: prompt (hasta 8,000 caracteres) e image_url.
¿Qué tan rápido es Moondream2?
Aún no hay suficientes ejecuciones medidas de Moondream2 en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.
¿Es Moondream2 mejor que BLIP?
Eso depende de la tarea. Moondream2 (Community) y BLIP (Salesforce) son ambos modelos en la categoría Multimodal. La página de comparación muestra sus precios y especificaciones lado a lado.
Comparar Moondream2 y BLIP¿Puede Moondream2 procesar imágenes?
Sí. Moondream2 acepta imágenes como entrada además de texto.
Modelos comparables
Todos en esta categoría- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Todos los modelos a través de una API
Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.