Segformer B5
segformer-b5NVIDIA SegFormer-B5 semantic segmentation. Hierarchical transformer encoder with lightweight MLP decoder, strong ADE20k and Cityscapes results.
- Pris
- ≈ 0,00030 US$/kørsel
- Input → output
- Tekst + Billede → Tekst
- Udvikler
- Community
- Opdateret
- 23. september 2026
Playground
Prøv Segformer B5
Ingen inputmaske
Ingen inputmaske til denne model endnu
Dens inputs er endnu ikke dokumenteret. For at ingen kørsel mislykkes på grund af forkert input tilbyder vi ikke en formular her. Vælg i stedet en sammenlignelig model.
Examples
InputNo text prompt: the model only takes the input shown.
Output (JSON, shortened)
[ { "mask": "iVBORw0KGgoAAAANSUhEUgAAAwAAAAMACAAAAAC26l9SAAAJrklEQVR4nO3d2XbjthIFUDIr///LykNst9oiJQ4YCqi9H+5K36QtiTyHBcga1sfS2Nr6BhtofhDfq3iIPz7SI7dd5IcU8k+7m4J4FIDUFKCEGZd1SbQvQLD1MrmZAKSmAKSmAEXYBIxKAWgt1C7w3/Y3+XC5HNbd7IbK/rIsXQpANmdj3/IKaQlEUa9hf8S77D9RgDIiLev63pdfcY8df0sgint8NzB49P+nABQ3RPK/WAKRmgKQmgIQTdN…", "label": "wall", "score": null }, { "mask": "iVBORw0KGgoAAAANSUhEUgAAAwAAAAMACAAAAAC26l9SAAARoklEQVR4nO3d2XaruBYFUHzH+f9f5j4kqThuMI22tCXN+VB1uiQYrYUExvayAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAA…", "label": "floor", "score": null }, { "mask": "iVBORw0KGgoAAAANSUhEUgAAAwAAAAMACAAAAAC26l9SAAAD/ElEQVR4nO3cUWrCQBRAUVO6/y3bj2IrtOJECMF3z1lAmOC7iegk24Vxrscdejvu0Of4OHsBcCYBkCYA0gRAmgBIEwBpAiBNAKQJgB3G/Q8mANoEQJoA5jlwK9A8AiBNAKQJgDQBkCYA0gRAmgBIEwBpAiBNAKQJgDQBkCYA0gRAmgBYN++BMAHQJgDSBECaAEgTAGkCIE0ApAmANAGQJgDSBECaAEgTAGkCIE0ApAmANAGQJgDSBECaAEg…", "label": "windowpane", "score": null }, { "mask": "iVBORw0KGgoAAAANSUhEUgAAAwAAAAMACAAAAAC26l9SAAAErklEQVR4nO3dMVLDUAxAQcL97xxKKOggkjJv9wJq/GZsf439+IBrnnOjPudGwT0CIE0ApAmANAGQJgDSBECaAEgTAGkC4JzBg2AB0CYA0gRAmgBIEwBpAiBNAFwz+RZUALQJgDQBkCYA0gRAmgC45jE5TACkCYA0AZAmANIEQJoASBMAaQIgTQCkCYA0AZAmANIEQJoASBMAaQIgTQCkCYA0AZAmANIEQJoASBMAaQIgTQCkCYA0AZAmANI…", "label": "door", "score": null }, { "mask": "iVBORw0KGgoAAAANS…
Om Segformer B5
Segformer B5 er en model af Community i kategorien Multimodal. På Railwail koster Segformer B5 ≈ 0,00030 US$ pr. kørsel.
Priser
| Typisk kørsel (≈ 1 s på T4) | 0,00030 US$ pr. kørsel |
|---|---|
| GPU-tid (T4) | 0,00027 US$ pr. GPU-sekund |
- Faktureres efter den GPU-tid, som kørslen faktisk tager. Når kørslen starter, reserveres 3× den typiske pris fra din saldo og afregnes efterfølgende.
- 1 kredit = 0,01 US$
Omkostningsberegner
Prisberegner
Typisk ifølge udbyderen: ca. 1 s
I alt
0,03 US$
3 credits
Pr. kørsel
0,0003 US$ · 0,03 credits
Fakturering efter faktisk GPU-tid; dette er et estimat.
API
Intet bekræftet API-eksempel
Den offentlige API sender et andet inputformat end det, som denne model har brug for. Brug playground ovenfor.
Specifikationer
- Model-ID
segformer-b5- Udvikler
- Community
- Kategori
- Multimodal
- Input
- Tekst, Billede
- Output
- Tekst
- Fakturering
- Efter forbrug (tokens eller GPU-tid)
- Katalogelement opdateret
- 23. september 2026
Tags
- replicate
- segmentation
- vision-understanding
- nvidia
- open-weights
Ofte stillede spørgsmål
Hvad er Segformer B5?
Segformer B5 er en model fra Community i kategorien Multimodal.
Hvad koster Segformer B5 på Railwail?
På Railwail koster Segformer B5 ≈ 0,00030 US$ pr. kørsel. Du betaler for det, som hver anmodning faktisk bruger. Forbrug betales fra forudbetalte credits; 1 credit svarer til 0,01 US$.
Hvor hurtig er Segformer B5?
Der er endnu ikke nok målte kørsler af Segformer B5 på Railwail til at angive en udførelsestid. Det afhænger af inputtet, indstillingerne og belastningen hos provideren.
Er Segformer B5 bedre end BLIP?
Det afhænger af opgaven. Segformer B5 (Community) og BLIP (Salesforce) er begge modeller i kategorien Multimodal. Sammenligningssiden viser deres priser og specifikationer side om side.
Sammenlign Segformer B5 og BLIPKan Segformer B5 behandle billeder?
Ja. Segformer B5 accepterer billeder som input ud over tekst.
Sammenlignelige modeller
Alle i denne kategori- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Alle modeller via én API
En API-nøgle til alle modeller på Railwail. Forbrug debiteres fra forudbetalte credits, 1 credit = 0,01 US$.