Molmo 7B

MultimodalDisponible
par CommunityID du modèle: molmo-7b

Allen AI Molmo 7B-D on Replicate. Open vision-language model trained on the PixMo data, notable for pointing at and locating objects in images, not just describing them.

Prix
≈ 0,0505 $US/exécution
Entrée → Sortie
Texte + Image → Texte
Développeur
Community
Mis à jour
23 septembre 2026
01

Playground

Essayer Molmo 7B

Entrée et résultat

≈ 0,0505 $US/exécution
Essayer Molmo 7B

0 / 16 000

Paramètres avancés (1)
Résultat
La réponse apparaît ici.

Cette exécution

environ 0,0505 $US · 5,05 crédits

0,1513 $US (15,13 crédits) sont réservés au démarrage ; le temps GPU réel est facturé.

Pour les comptes sans achat antérieur : les exécutions au-delà de 2 crédits nécessitent un rechargement.

Nouveau par ici ?

10 crédits gratuits (0,10 $US) à l'inscription avec Google

Utilisable 24 heures après l'inscription, jusqu'à 5 exécutions par jour et au maximum 2 crédits par exécution. Les autres méthodes de connexion commencent sans crédits.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    What do you see? Give me a detailed answer

    Response

    I see a charming scene featuring a large, fluffy white dog sitting on a wooden bench in the middle of a field. The dog appears to be a poodle mix, with curly fur covering its entire body. It's sitting upright with its front paws hanging over the edge of the bench, looking directly at the camera with a happy expression. The dog's tongue is hanging out, and its eyes are dark and expressive. The bench is made of dark brown wood with a lattice design on the backrest. It's positioned on a patch of brown, dead grass, which suggests it might be late fall or early winter. In the background, there's a vast field filled with tall, brown grass, and further back, I can see a line of bare trees against a light blue sky. The overall atmosphere is peaceful and serene. The dog seems to be enjoying its time outdoors, perhaps waiting for its owner or just taking in the scenery. The contrast between the white, fluffy dog and the brown

03

À propos de Molmo 7B

RésuméAu 23 septembre 2026

Molmo 7B est un modèle de Community dans la catégorie Multimodal. Sur Railwail, Molmo 7B coûte ≈ 0,0505 $US par exécution.

Molmo 7B-D from Allen AI is an open vision-language model trained on the PixMo human-annotated dataset. Beyond captioning and visual question answering it can point to and localize specific objects in an image, returning coordinates, which is useful for grounding and agentic UI tasks. This Replicate endpoint takes an image plus a prompt and returns text answers or pointing outputs. Fully open weights and data.
04

Tarification

Prix en dollars américains. L'utilisation est facturée à partir de crédits prépayés.
Exécution typique (≈ 43 s sur L40S)0,0505 $US par exécution
Temps GPU (L40S)0,00117 $US par seconde GPU
  • Facturée selon le temps GPU que l'exécution prend réellement. Au démarrage, 3× le prix typique est réservé de votre solde et régularisé ensuite.
  • 1 crédit = 0,01 $US

Calculatrice de coûts

Calculatrice de prix

s

Typique selon le fournisseur : environ 43,1 s

Total

5,05 $US

505 crédits

Par exécution

0,0505 $US · 5,05 crédits

Facturé selon le temps GPU réel ; ceci est une estimation.

05

API

Appelez Molmo 7B avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Aucun exemple API vérifié

L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.

06

Spécifications

ID du modèle
molmo-7b
Développeur
Community
Catégorie
Multimodal
Entrée
Texte, Image
Sortie
Texte
Facturation
À l'usage (tokens ou temps GPU)
Entrée du catalogue mise à jour
23 septembre 2026

Paramètres d'entrée

Entrées et paramètres du schéma d'entrée du modèle. L'exemple dans la section API montre lesquels l'API accepte.

  • promptObligatoire

    Question about the image

    Type: Texte
    Par défaut: –
    Valeurs autorisées: Jusqu'à 16 000 caractères
  • image_url

    Image URL to analyze

    Type: Texte
    Par défaut: –
    Valeurs autorisées: –
  • max_tokens
    Type: Nombre entier
    Par défaut: 1024
    Valeurs autorisées: 1 à 4 096

Étiquettes

  • replicate
  • allenai
  • molmo
  • vision-understanding
  • open-weights
  • grounding
07

Questions fréquemment posées

Qu'est-ce que Molmo 7B ?

Molmo 7B est un modèle de Community dans la catégorie Multimodal.

Combien coûte Molmo 7B sur Railwail ?

Sur Railwail, Molmo 7B coûte ≈ 0,0505 $US par exécution. Vous êtes facturé pour ce que chaque requête utilise réellement. L'utilisation est payée à partir de crédits prépayés ; 1 crédit équivaut à 0,01 $US.

Quels paramètres Molmo 7B supporte-t-il ?

Selon son schéma d'entrée, Molmo 7B connaît ces paramètres : prompt (Jusqu'à 16 000 caractères), image_url et max_tokens (1 à 4 096).

Quelle est la vitesse de Molmo 7B ?

Il n'y a pas encore assez d'exécutions mesurées de Molmo 7B sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

Molmo 7B est-il meilleur que BLIP ?

Cela dépend de la tâche. Molmo 7B (Community) et BLIP (Salesforce) sont tous deux des modèles de la catégorie Multimodal. La page de comparaison affiche leurs prix et spécifications côte à côte.

Comparer Molmo 7B et BLIP

Molmo 7B peut-il traiter des images ?

Oui. Molmo 7B accepte les images en entrée en plus du texte.

08

Modèles comparables

Tous dans cette catégorie
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $US/exécution

    99 % moins cher par unité

    Comparer Molmo 7B et BLIP
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ 0,0457 $US/exécution

    10 % moins cher par unité

    Comparer Molmo 7B et CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ 0,0050 $US/exécution

    90 % moins cher par unité

    Comparer Molmo 7B et Depth Anything v2

Tous les modèles via une API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.