Molmo 7B

MultimodalΔιαθέσιμο
από CommunityΑναγνωριστικό μοντέλου: molmo-7b

Allen AI Molmo 7B-D on Replicate. Open vision-language model trained on the PixMo data, notable for pointing at and locating objects in images, not just describing them.

Τιμή
≈ 0,0505 $/εκτέλεση
Είσοδος → Έξοδος
Κείμενο + Εικόνα → Κείμενο
Προγραμματιστής
Community
Ενημερώθηκε
23 Σεπτεμβρίου 2026
01

Playground

Δοκιμάστε Molmo 7B

Είσοδος & Έξοδος

≈ 0,0505 $/εκτέλεση
Δοκιμάστε Molmo 7B

0 / 16.000

Προηγμένες ρυθμίσεις (1)
Αποτέλεσμα
Η απάντηση εμφανίζεται εδώ.

Αυτή η εκτέλεση

περίπου 0,0505 $ · 5,05 πιστωτικές μονάδες

0,1513 $ (15,13 πιστωτικές μονάδες) προεπιλέγονται κατά την έναρξη· ο πραγματικός χρόνος GPU χρεώνεται.

Για λογαριασμούς χωρίς αγορά: εκτελέσεις πάνω από 2 πιστωτικές μονάδες χρειάζονται ανεβάσματος.

Νέος εδώ;

10 δωρεάν πιστωτικές μονάδες (0,10 $) όταν εγγραφείς με Google

Χρησιμοποιήσιμο 24 ώρες μετά την εγγραφή, έως 5 εκτελέσεις ανά ημέρα και το πολύ 2 πιστωτικές μονάδες ανά εκτέλεση. Άλλες μέθοδοι σύνδεσης ξεκινούν χωρίς πιστωτικές μονάδες.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    What do you see? Give me a detailed answer

    Response

    I see a charming scene featuring a large, fluffy white dog sitting on a wooden bench in the middle of a field. The dog appears to be a poodle mix, with curly fur covering its entire body. It's sitting upright with its front paws hanging over the edge of the bench, looking directly at the camera with a happy expression. The dog's tongue is hanging out, and its eyes are dark and expressive. The bench is made of dark brown wood with a lattice design on the backrest. It's positioned on a patch of brown, dead grass, which suggests it might be late fall or early winter. In the background, there's a vast field filled with tall, brown grass, and further back, I can see a line of bare trees against a light blue sky. The overall atmosphere is peaceful and serene. The dog seems to be enjoying its time outdoors, perhaps waiting for its owner or just taking in the scenery. The contrast between the white, fluffy dog and the brown

03

Σχετικά με το Molmo 7B

ΣύντομαΗμερομηνία: 23 Σεπτεμβρίου 2026

Το Molmo 7B είναι ένα μοντέλο του Community στην κατηγορία Multimodal. Στο Railwail, το Molmo 7B κοστίζει ≈ 0,0505 $ ανά εκτέλεση.

Molmo 7B-D from Allen AI is an open vision-language model trained on the PixMo human-annotated dataset. Beyond captioning and visual question answering it can point to and localize specific objects in an image, returning coordinates, which is useful for grounding and agentic UI tasks. This Replicate endpoint takes an image plus a prompt and returns text answers or pointing outputs. Fully open weights and data.
04

Τιμολόγηση

Οι τιμές είναι σε δολάρια ΗΠΑ. Η χρήση χρεώνεται από προπληρωμένα πιστωτικά.
Συνήθης εκτέλεση (≈ 43 s σε L40S)0,0505 $ ανά εκτέλεση
Χρόνος GPU (L40S)0,00117 $ ανά δευτερόλεπτο GPU
  • Χρέωση με βάση τον χρόνο GPU που χρειάζεται πραγματικά η εκτέλεση. Κατά την έναρξη, το 3× της τυπικής τιμής δεσμεύεται από το υπόλοιπό σας και διακανονίζεται αργότερα.
  • 1 πιστωτική μονάδα = 0,01 $

Αριθμομηχανή κόστους

Αριθμομηχανή τιμών

s

Τυπικά σύμφωνα με τον πάροχο: περίπου 43,1 s

Σύνολο

5,05 $

505 πιστωτικές μονάδες

Ανά εκτέλεση

0,0505 $ · 5,05 πιστωτικές μονάδες

Χρέωση με βάση τον πραγματικό χρόνο GPU· αυτή είναι μια εκτίμηση.

05

API

Καλέστε το Molmo 7B με το κλειδί Railwail API. Χρησιμοποιήστε αυτό το ID μοντέλου στο αίτημα:

Κανένα επαληθευμένο παράδειγμα API

Το δημόσιο API περνά μια διαφορετική μορφή εισόδου από αυτή που χρειάζεται αυτό το μοντέλο. Χρησιμοποιήστε το playground παραπάνω.

06

Προδιαγραφές

ID μοντέλου
molmo-7b
Ανάπτυξη
Community
Κατηγορία
Multimodal
Είσοδος
Κείμενο, Εικόνα
Έξοδος
Κείμενο
Χρέωση
Κατά χρήση (tokens ή χρόνος GPU)
Καταχώρηση καταλόγου ενημερώθηκε
23 Σεπτεμβρίου 2026

Παράμετροι εισόδου

Εισόδους και ρυθμίσεις από το σχήμα εισόδου του μοντέλου. Το παράδειγμα στην ενότητα API δείχνει ποιες από αυτές δέχεται το API.

  • promptΥποχρεωτικό

    Question about the image

    Τύπος: Κείμενο
    Προεπιλογή: –
    Επιτρεπόμενες τιμές: Έως 16.000 χαρακτήρες
  • image_url

    Image URL to analyze

    Τύπος: Κείμενο
    Προεπιλογή: –
    Επιτρεπόμενες τιμές: –
  • max_tokens
    Τύπος: Ακέραιος αριθμός
    Προεπιλογή: 1024
    Επιτρεπόμενες τιμές: 1 έως 4.096

Ετικέτες

  • replicate
  • allenai
  • molmo
  • vision-understanding
  • open-weights
  • grounding
07

Συχνές ερωτήσεις

Τι είναι Molmo 7B;

Το Molmo 7B είναι ένα μοντέλο του Community στην κατηγορία Multimodal.

Πόσο κοστίζει το Molmo 7B στο Railwail;

Στο Railwail, το Molmo 7B κοστίζει ≈ 0,0505 $ ανά εκτέλεση. Χρεώνεστε για αυτό που χρησιμοποιεί πραγματικά κάθε αίτημα. Η χρήση πληρώνεται από προπληρωμένες πιστωτικές μονάδες· 1 πιστωτική μονάδα ισούται με 0,01 $.

Ποιες ρυθμίσεις υποστηρίζει το Molmo 7B;

Σύμφωνα με το σχήμα εισόδου του, το Molmo 7B γνωρίζει αυτές τις παραμέτρους: prompt (Έως 16.000 χαρακτήρες), image_url και max_tokens (1 έως 4.096).

Πόσο γρήγορο είναι το Molmo 7B;

Δεν υπάρχουν αρκετές μετρημένες εκτελέσεις του Molmo 7B στο Railwail ακόμα για να δηλωθεί ένας χρόνος εκτέλεσης. Εξαρτάται από την είσοδο, τις ρυθμίσεις και το φορτίο στον πάροχο.

Είναι το Molmo 7B καλύτερο από το BLIP;

Αυτό εξαρτάται από την εργασία. Το Molmo 7B (Community) και το BLIP (Salesforce) είναι και τα δύο μοντέλα στην κατηγορία Multimodal. Η σελίδα σύγκρισης δείχνει τις τιμές και τις προδιαγραφές τους παράλληλα.

Σύγκριση Molmo 7B και BLIP

Μπορεί το Molmo 7B να επεξεργαστεί εικόνες;

Ναι. Το Molmo 7B δέχεται εικόνες ως είσοδο εκτός από κείμενο.

08

Συγκρίσιμα μοντέλα

Όλα σε αυτήν την κατηγορία
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $/εκτέλεση

    99 % φθηνότερο ανά μονάδα

    Σύγκριση Molmo 7B και BLIP
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ 0,0457 $/εκτέλεση

    10 % φθηνότερο ανά μονάδα

    Σύγκριση Molmo 7B και CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ 0,0050 $/εκτέλεση

    90 % φθηνότερο ανά μονάδα

    Σύγκριση Molmo 7B και Depth Anything v2

Όλα τα μοντέλα μέσω ενός API

Ένα κλειδί API για κάθε μοντέλο στο Railwail. Η χρήση χρεώνεται από προπληρωμένα πιστωτικά, 1 πιστωτικό = 0,01 $.