Segformer B5
segformer-b5NVIDIA SegFormer-B5 semantic segmentation. Hierarchical transformer encoder with lightweight MLP decoder, strong ADE20k and Cityscapes results.
- Preço
- ≈ US$ 0,00030/execução
- Entrada → Saída
- Texto + Imagem → Texto
- Desenvolvedor
- Community
- Atualizado
- 23 de setembro de 2026
Playground
Experimentar Segformer B5
Sem formulário de entrada
Ainda não há formulário de entrada para este modelo
Suas entradas ainda não foram documentadas. Para que nenhuma execução falhe com uma entrada incorreta, não oferecemos um formulário aqui. Escolha um modelo comparável em vez disso.
Examples
InputNo text prompt: the model only takes the input shown.
Output (JSON, shortened)
[ { "mask": "iVBORw0KGgoAAAANSUhEUgAAAwAAAAMACAAAAAC26l9SAAAJrklEQVR4nO3d2XbjthIFUDIr///LykNst9oiJQ4YCqi9H+5K36QtiTyHBcga1sfS2Nr6BhtofhDfq3iIPz7SI7dd5IcU8k+7m4J4FIDUFKCEGZd1SbQvQLD1MrmZAKSmAKSmAEXYBIxKAWgt1C7w3/Y3+XC5HNbd7IbK/rIsXQpANmdj3/IKaQlEUa9hf8S77D9RgDIiLev63pdfcY8df0sgint8NzB49P+nABQ3RPK/WAKRmgKQmgIQTdN…", "label": "wall", "score": null }, { "mask": "iVBORw0KGgoAAAANSUhEUgAAAwAAAAMACAAAAAC26l9SAAARoklEQVR4nO3d2XaruBYFUHzH+f9f5j4kqThuMI22tCXN+VB1uiQYrYUExvayAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAA…", "label": "floor", "score": null }, { "mask": "iVBORw0KGgoAAAANSUhEUgAAAwAAAAMACAAAAAC26l9SAAAD/ElEQVR4nO3cUWrCQBRAUVO6/y3bj2IrtOJECMF3z1lAmOC7iegk24Vxrscdejvu0Of4OHsBcCYBkCYA0gRAmgBIEwBpAiBNAKQJgB3G/Q8mANoEQJoA5jlwK9A8AiBNAKQJgDQBkCYA0gRAmgBIEwBpAiBNAKQJgDQBkCYA0gRAmgBYN++BMAHQJgDSBECaAEgTAGkCIE0ApAmANAGQJgDSBECaAEgTAGkCIE0ApAmANAGQJgDSBECaAEg…", "label": "windowpane", "score": null }, { "mask": "iVBORw0KGgoAAAANSUhEUgAAAwAAAAMACAAAAAC26l9SAAAErklEQVR4nO3dMVLDUAxAQcL97xxKKOggkjJv9wJq/GZsf439+IBrnnOjPudGwT0CIE0ApAmANAGQJgDSBECaAEgTAGkC4JzBg2AB0CYA0gRAmgBIEwBpAiBNAFwz+RZUALQJgDQBkCYA0gRAmgC45jE5TACkCYA0AZAmANIEQJoASBMAaQIgTQCkCYA0AZAmANIEQJoASBMAaQIgTQCkCYA0AZAmANIEQJoASBMAaQIgTQCkCYA0AZAmANI…", "label": "door", "score": null }, { "mask": "iVBORw0KGgoAAAANS…
Sobre Segformer B5
Segformer B5 é um modelo de Community na categoria Multimodal. No Railwail, Segformer B5 custa ≈ US$ 0,00030 por execução.
Preços
| Execução típica (≈ 1 s em T4) | US$ 0,00030 por execução |
|---|---|
| Tempo de GPU (T4) | US$ 0,00027 por segundo de GPU |
- Faturado pelo tempo de GPU que a execução realmente leva. Quando a execução começa, 3× o preço típico é reservado do seu saldo e liquidado depois.
- 1 crédito = US$ 0,01
Calculadora de custos
Calculadora de preços
Típico conforme o provedor: cerca de 1 s
Total
US$ 0,03
3 créditos
Por execução
US$ 0,0003 · 0,03 créditos
Faturado pelo tempo real de GPU; este é uma estimativa.
API
Nenhum exemplo de API verificado
A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.
Especificações
- ID do modelo
segformer-b5- Desenvolvedor
- Community
- Categoria
- Multimodal
- Entrada
- Texto, Imagem
- Saída
- Texto
- Faturamento
- Por uso (tokens ou tempo de GPU)
- Entrada do catálogo atualizada
- 23 de setembro de 2026
Etiquetas
- replicate
- segmentation
- vision-understanding
- nvidia
- open-weights
Perguntas frequentes
O que é Segformer B5?
Segformer B5 é um modelo de Community na categoria Multimodal.
Quanto custa Segformer B5 no Railwail?
No Railwail, Segformer B5 custa ≈ US$ 0,00030 por execução. Você é cobrado pelo que cada solicitação realmente usa. O uso é pago com créditos pré-pagos; 1 crédito equivale a US$ 0,01.
Qual é a velocidade de Segformer B5?
Ainda não há execuções medidas suficientes de Segformer B5 no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.
Segformer B5 é melhor que BLIP?
Depende da tarefa. Segformer B5 (Community) e BLIP (Salesforce) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.
Comparar Segformer B5 e BLIPSegformer B5 pode processar imagens?
Sim. Segformer B5 aceita imagens como entrada além de texto.
Modelos comparáveis
Todos nesta categoria- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Todos os modelos através de uma API
Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.