CogVLM2 19B

MultimodalDisponible
par CommunityID du modèle: cogvlm2-19b

Tsinghua CogVLM2 19B with Llama-3 8B base plus 11B vision expert. Strong document understanding and visual reasoning, 8k context.

Prix
≈ 0,0114 $US/exécution
Contexte
8 192 tokens
Max. sortie
2 048 tokens
Entrée → Sortie
Texte + Image → Texte
Développeur
Community
Mis à jour
23 septembre 2026
01

Playground

Essayer CogVLM2 19B

Pas de formulaire d'entrée

≈ 0,0114 $US/exécution

Aucun formulaire d'entrée pour ce modèle pour le moment

Ses entrées ne sont pas encore documentées. Pour éviter qu'une exécution échoue sur une entrée incorrecte, nous ne proposons pas de formulaire ici. Choisissez plutôt un modèle comparable.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    Describe this image.

    Response

    The image captures a well-lit, modern library or bookstore with a distinct industrial aesthetic. The main focus is a large, wooden bookshelf filled with an assortment of books, creating a warm and inviting atmosphere. The bookshelf is positioned against a rustic brick wall, which adds a touch of vintage charm to the space. The room is illuminated by hanging light bulbs, which dangle from the ceiling in a casual manner. There are also decorative elements such as a potted plant, a small framed sign, and a table with various items on it, enhancing the cozy ambiance. A person is seated at a desk in the foreground, suggesting the space is functional for reading or studying.

03

À propos de CogVLM2 19B

RésuméAu 23 septembre 2026

CogVLM2 19B est un modèle de Community dans la catégorie Multimodal. Sur Railwail, CogVLM2 19B coûte ≈ 0,0114 $US par exécution. La fenêtre de contexte contient 8 192 tokens, et une réponse peut faire jusqu'à 2 048 tokens.

04

Tarification

Prix en dollars US. L'utilisation est facturée à partir de crédits prépayés.
Exécution typique (≈ 10 s sur L40S)0,0114 $US par exécution
Temps GPU (L40S)0,00117 $US par seconde GPU
  • Facturé selon le temps GPU réellement utilisé. Au démarrage, 3× le prix typique est réservé sur votre solde et régularisé ensuite.
  • 1 crédit = 0,01 $US

Calculateur de coûts

Calculateur de prix

s

Typique selon le fournisseur : environ 9,7 s

Total

1,14 $US

114 crédits

Par exécution

0,0114 $US · 1,14 crédits

Facturé selon le temps GPU réel ; ceci est une estimation.

05

API

Appelez CogVLM2 19B avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Aucun exemple API vérifié

L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.

06

Spécifications

ID du modèle
cogvlm2-19b
Développeur
Community
Catégorie
Multimodal
Entrée
Texte, Image
Sortie
Texte
Fenêtre de contexte
8 192 tokens
Sortie max.
2 048 tokens
Facturation
À l'usage (tokens ou temps GPU)
Entrée du catalogue mise à jour
23 septembre 2026

Étiquettes

  • replicate
  • multimodal
  • vision-understanding
  • tsinghua
  • open-weights
07

Questions fréquemment posées

Qu'est-ce que CogVLM2 19B ?

CogVLM2 19B est un modèle de Community dans la catégorie Multimodal.

Combien coûte CogVLM2 19B sur Railwail ?

Sur Railwail, CogVLM2 19B coûte ≈ 0,0114 $US par exécution. Vous êtes facturé pour ce que chaque requête utilise réellement. L'utilisation est payée à partir de crédits prépayés ; 1 crédit équivaut à 0,01 $US.

Quelle est la fenêtre de contexte de CogVLM2 19B ?

La fenêtre de contexte de CogVLM2 19B contient 8 192 tokens. Une réponse peut faire jusqu'à 2 048 tokens.

Quelle est la vitesse de CogVLM2 19B ?

Il n'y a pas encore assez d'exécutions mesurées de CogVLM2 19B sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

CogVLM2 19B est-il meilleur que BLIP ?

Cela dépend de la tâche. CogVLM2 19B (Community) et BLIP (Salesforce) sont tous deux des modèles de la catégorie Multimodal. La page de comparaison affiche leurs prix et spécifications côte à côte.

Comparer CogVLM2 19B et BLIP

CogVLM2 19B peut-il traiter des images ?

Oui. CogVLM2 19B accepte les images en entrée en plus du texte.

08

Modèles comparables

Tous dans cette catégorie
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $US/exécution

    97 % moins cher par unité

    Comparer CogVLM2 19B et BLIP
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ 0,0457 $US/exécution

    301 % plus cher par unité

    Comparer CogVLM2 19B et CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ 0,0050 $US/exécution

    56 % moins cher par unité

    Comparer CogVLM2 19B et Depth Anything v2

Tous les modèles via une seule API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.