Florence-2 Large
florence-2-largeMicrosoft Florence-2 Large. Unified prompt-based vision foundation model for captioning, detection, segmentation and OCR with a single 770M-param backbone.
- Precio
- ≈ 0,0012 US$/ejecución
- Entrada → Salida
- Texto + Imagen → Texto
- Desarrollador
- Community
- Actualizado
- 23 de septiembre de 2026
Playground
Probar Florence-2 Large
Entrada y salida
Esta ejecución
aprox. 0,0012 US$ · 0,12 créditos
Se reservan 0,0036 US$ (0,36 créditos) al inicio; se factura el tiempo real de GPU.
¿Eres nuevo aquí?
10 créditos gratis (0,10 US$) cuando te registres con Google
Disponible 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos. Suficiente para 27 ejecuciones de este modelo.
Examples
Open full size
InputNo text prompt: the model only takes the input shown.
Open full size
InputNo text prompt: the model only takes the input shown.
Open full size
InputNo text prompt: the model only takes the input shown.
Acerca de Florence-2 Large
Florence-2 Large es un modelo de Community en la categoría Multimodal. En Railwail, Florence-2 Large cuesta ≈ 0,0012 US$ por ejecución.
Precios
| Ejecución típica (≈ 1 s en L40S) | 0,0012 US$ por ejecución |
|---|---|
| Tiempo de GPU (L40S) | 0,00117 US$ por segundo de GPU |
- Se factura por el tiempo de GPU que realmente tarda la ejecución. Cuando comienza la ejecución, se reserva 3× el precio típico de tu saldo y se liquida después.
- 1 crédito = 0,01 US$
Calculadora de costes
Calculadora de precios
Típico según el proveedor: aprox. 1 s
Total
0,12 US$
12 créditos
Por ejecución
0,0012 US$ · 0,12 créditos
Se factura el tiempo real de GPU; este es un estimado.
API
Sin ejemplo de API verificado
La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.
Especificaciones
- ID del modelo
florence-2-large- Desarrollador
- Community
- Categoría
- Multimodal
- Entrada
- Texto, Imagen
- Salida
- Texto
- Facturación
- Por uso (tokens o tiempo de GPU)
- Entrada del catálogo actualizada
- 23 de septiembre de 2026
Parámetros de entrada
Entradas y configuración del esquema de entrada del modelo. El ejemplo en la sección API muestra cuáles de ellas acepta la API.
promptObligatorioUser message or task instruction
Tipo: TextoPredeterminado: –Valores permitidos: Hasta 4000 caracterestaskTipo: OpciónPredeterminado:captionValores permitidos: caption, detailed_caption, ocr, object_detection o segmentationimage_urlImage URL to analyze
Tipo: TextoPredeterminado: –Valores permitidos: –max_tokensTipo: Número enteroPredeterminado:1024Valores permitidos: 1 a 4096temperatureTipo: NúmeroPredeterminado:0.7Valores permitidos: 0 a 2
Etiquetas
- replicate
- multimodal
- vision-understanding
- microsoft
- open-weights
Preguntas frecuentes
¿Qué es Florence-2 Large?
Florence-2 Large es un modelo de Community en la categoría Multimodal.
¿Cuánto cuesta Florence-2 Large en Railwail?
En Railwail, Florence-2 Large cuesta ≈ 0,0012 US$ por ejecución. Se te cobra por lo que cada solicitud realmente consume. El uso se paga con créditos prepagados; 1 crédito equivale a 0,01 US$.
¿Qué configuraciones admite Florence-2 Large?
Según su esquema de entrada, Florence-2 Large conoce estos parámetros: prompt (Hasta 4000 caracteres), task (caption, detailed_caption, ocr, object_detection o segmentation), image_url, max_tokens (1 a 4096) y temperature (0 a 2).
¿Qué velocidad tiene Florence-2 Large?
Aún no hay suficientes ejecuciones medidas de Florence-2 Large en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.
¿Es Florence-2 Large mejor que BLIP?
Depende de la tarea. Florence-2 Large (Community) y BLIP (Salesforce) son ambos modelos en la categoría Multimodal. La página de comparación muestra sus precios y especificaciones lado a lado.
Comparar Florence-2 Large y BLIP¿Puede Florence-2 Large procesar imágenes?
Sí. Florence-2 Large acepta imágenes como entrada además de texto.
Modelos comparables
Todos en esta categoría- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Todos los modelos a través de una API
Una clave API para todos los modelos en Railwail. El uso se cobra desde créditos prepagados, 1 crédito = 0,01 US$.