Molmo 7B

MultimodalMevcut
Community tarafındanModel Kimliği: molmo-7b

Allen AI Molmo 7B-D on Replicate. Open vision-language model trained on the PixMo data, notable for pointing at and locating objects in images, not just describing them.

Fiyat
≈ $0,0505/çalıştırma
Giriş → Çıkış
Metin + Görüntü → Metin
Geliştirici
Community
Güncellendi
23 Eylül 2026
01

Playground

Molmo 7B'ı deneyin

Giriş & Sonuç

≈ $0,0505/çalıştırma
Molmo 7B'ı deneyin

0 / 16.000

Gelişmiş ayarlar (1)
Sonuç
Yanıt burada görünür.

Bu çalıştırma

yaklaşık $0,0505 · 5,05 kredi

Başlangıçta $0,1513 (15,13 kredi) ayrılır; gerçek GPU süresi faturalandırılır.

Satın alma olmayan hesaplar için: 2 kredinin üzerindeki çalıştırmalar bir yükleme gerektirir.

Yeni misiniz?

Google ile kaydolduğunuzda 10 ücretsiz kredi ($0,10)

Kaydolduktan 24 saat sonra kullanılabilir, günde 5 çalıştırmaya kadar ve çalıştırma başına en fazla 2 kredi. Diğer oturum açma yöntemleri kredi olmadan başlar.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    What do you see? Give me a detailed answer

    Response

    I see a charming scene featuring a large, fluffy white dog sitting on a wooden bench in the middle of a field. The dog appears to be a poodle mix, with curly fur covering its entire body. It's sitting upright with its front paws hanging over the edge of the bench, looking directly at the camera with a happy expression. The dog's tongue is hanging out, and its eyes are dark and expressive. The bench is made of dark brown wood with a lattice design on the backrest. It's positioned on a patch of brown, dead grass, which suggests it might be late fall or early winter. In the background, there's a vast field filled with tall, brown grass, and further back, I can see a line of bare trees against a light blue sky. The overall atmosphere is peaceful and serene. The dog seems to be enjoying its time outdoors, perhaps waiting for its owner or just taking in the scenery. The contrast between the white, fluffy dog and the brown

03

Molmo 7B Hakkında

Özet23 Eylül 2026 itibariyle

Molmo 7B, Community tarafından Multimodal kategorisinde geliştirilen bir modeldir. Railwail üzerinde Molmo 7B maliyeti ≈ $0,0505 çalıştırma başına.

Molmo 7B-D from Allen AI is an open vision-language model trained on the PixMo human-annotated dataset. Beyond captioning and visual question answering it can point to and localize specific objects in an image, returning coordinates, which is useful for grounding and agentic UI tasks. This Replicate endpoint takes an image plus a prompt and returns text answers or pointing outputs. Fully open weights and data.
04

Fiyatlandırma

Fiyatlar ABD doları cinsinden. Kullanım, ön ödemeli kredilerden tahsil edilir.
Tipik çalıştırma (≈ 43 s, L40S üzerinde)$0,0505 çalıştırma başına
GPU Süresi (L40S)$0,00117 GPU saniyesi başına
  • Çalıştırmanın gerçekten aldığı GPU süresi için faturalandırılır. Çalıştırma başladığında, bakiyenizden tipik fiyatın 3 katı ayrılır ve daha sonra kapatılır.
  • 1 kredi = $0,01

Maliyet Hesaplayıcı

Fiyat hesaplayıcı

s

Sağlayıcıya göre tipik: yaklaşık 43,1 s

Toplam

$5,05

505 kredi

Çalışma başına

$0,0505 · 5,05 kredi

Gerçek GPU süresi faturalandırılır; bu bir tahmindir.

05

API

Molmo 7B öğesini Railwail API anahtarınızla çağırın. İstekte bu model kimliğini kullanın:

Doğrulanmış API örneği yok

Genel API, bu modelin ihtiyaç duyduğundan farklı bir giriş biçimi iletir. Yukarıdaki oyun alanını kullanın.

06

Özellikler

Model Kimliği
molmo-7b
Geliştirici
Community
Kategori
Multimodal
Giriş
Metin, Görüntü
Çıkış
Metin
Faturalandırma
Kullanıma göre (token veya GPU süresi)
Katalog girişi güncellendi
23 Eylül 2026

Giriş Parametreleri

Modelin giriş şemasından giriş ve ayarlar. API bölümündeki örnek, API'nin hangilerini kabul ettiğini gösterir.

  • promptgerekli

    Question about the image

    Tür: Metin
    Varsayılan: –
    İzin verilen değerler: en fazla 16.000 karakter
  • image_url

    Image URL to analyze

    Tür: Metin
    Varsayılan: –
    İzin verilen değerler: –
  • max_tokens
    Tür: Tam sayı
    Varsayılan: 1024
    İzin verilen değerler: 1 ile 4.096 arasında

Etiketler

  • replicate
  • allenai
  • molmo
  • vision-understanding
  • open-weights
  • grounding
07

Sık Sorulan Sorular

Molmo 7B nedir?

Molmo 7B, Community tarafından Multimodal kategorisinde oluşturulan bir modeldir.

Molmo 7B Railwail'de ne kadar maliyetlidir?

Railwail üzerinde Molmo 7B maliyeti ≈ $0,0505 çalıştırma başına. Her istek gerçekten ne kadar kullanırsa o kadar ücretlendirilirsiniz. Kullanım ön ödemeli kredilerden ödenir; 1 kredi $0,01 değerindedir.

Molmo 7B hangi ayarları destekler?

Giriş şemasına göre Molmo 7B şu parametreleri bilir: prompt (en fazla 16.000 karakter), image_url ve max_tokens (1 ile 4.096 arasında).

Molmo 7B ne kadar hızlıdır?

Railwail'de Molmo 7B için henüz çalıştırma süresi belirtmek için yeterli ölçülen çalıştırma yoktur. Bu, giriş, ayarlar ve sağlayıcıdaki yüke bağlıdır.

Molmo 7B, BLIP'dan daha iyi midir?

Bu göreve bağlıdır. Molmo 7B (Community) ve BLIP (Salesforce) her ikisi de Multimodal kategorisinde modellerdir. Karşılaştırma sayfası fiyatlarını ve özelliklerini yan yana gösterir.

Molmo 7B ve BLIP'ı karşılaştır

Molmo 7B görüntüleri işleyebilir mi?

Evet. Molmo 7B metne ek olarak giriş olarak görüntüleri kabul eder.

08

Karşılaştırılabilir modeller

Bu kategorideki tümü
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ $0,00030/çalıştırma

    Birim başına 99 % daha ucuz

    Molmo 7B ve BLIP karşılaştır
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ $0,0457/çalıştırma

    Birim başına 10 % daha ucuz

    Molmo 7B ve CLIP Interrogator karşılaştır
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ $0,0050/çalıştırma

    Birim başına 90 % daha ucuz

    Molmo 7B ve Depth Anything v2 karşılaştır

Tüm Modeller Tek Bir API Aracılığıyla

Railwail'deki her model için bir API anahtarı. Kullanım, ön ödemeli kredilerden tahsil edilir, 1 kredi = $0,01.