MiniCPM-V 2.6
minicpm-v-2-6OpenBMB MiniCPM-V 2.6. 8B vision-language model with strong single-image, multi-image and video understanding plus OCR capabilities.
- Prix
- ≈ 0,0015 $US/exécution
- Contexte
- 32 768 tokens
- Max. sortie
- 4 096 tokens
- Entrée → Sortie
- Texte + Image + Vidéo → Texte
- Développeur
- Community
- Mis à jour
- 23 septembre 2026
Playground
Essayer MiniCPM-V 2.6
Pas de formulaire d'entrée
Aucun formulaire d'entrée pour ce modèle pour le moment
Ses entrées ne sont pas encore documentées. Pour éviter qu'une exécution échoue avec une mauvaise entrée, nous ne proposons pas de formulaire ici. Choisissez plutôt un modèle comparable.
Examples
Response
视频展示了几个场景,强调了学习和实践的重要性。首先,一个穿着围裙的人正在用蓝色胶带做标记,暗示着一个装修或艺术项目。接着,一个小组在办公室环境中开会,强调了团队合作和知识分享。然后,视频展示了一个人在篮球场上投篮,象征着通过实践学习和成长。最后,展示了一个人在厨房里撒糖粉,可能是在烘焙,强调了将知识应用于实践。这些场景共同传达了不断学习和实践知识的重要性,无论是在个人成长还是职业发展中。
Response
这幅图片展示了一个年轻男性的动画角色,他有着深棕色的头发和棕色的眼睛,微微泛红的脸颊,表明他可能感到害羞或兴奋。他穿着一件简单的白色短袖衬衫,背着一个黑色背包,暗示他可能是一个学生或旅行者。他的姿势轻松,一只手托着头,另一只手放在膝盖上,表明他处于放松或思考的状态。背景是一个郁郁葱葱的森林,阳光透过树叶洒下,营造出宁静的氛围。柔和的光线和散落的心形光斑增添了场景的梦幻和浪漫氛围。
À propos de MiniCPM-V 2.6
MiniCPM-V 2.6 est un modèle de Community dans la catégorie Multimodal. Sur Railwail, MiniCPM-V 2.6 coûte ≈ 0,0015 $US par exécution. La fenêtre de contexte contient 32 768 tokens, et une réponse peut faire jusqu'à 4 096 tokens.
Tarification
| Exécution typique (≈ 1 s sur L40S) | 0,0015 $US par exécution |
|---|---|
| Temps GPU (L40S) | 0,00117 $US par seconde GPU |
- Facturée selon le temps GPU que l'exécution prend réellement. Au démarrage, 3× le prix typique est réservé de votre solde et régularisé ensuite.
- 1 crédit = 0,01 $US
Calculatrice de coûts
Calculatrice de prix
Typique selon le fournisseur : environ 1,2 s
Total
0,15 $US
15 crédits
Par exécution
0,0015 $US · 0,15 crédits
Facturé selon le temps GPU réel ; ceci est une estimation.
API
Aucun exemple API vérifié
L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.
Spécifications
- ID du modèle
minicpm-v-2-6- Développeur
- Community
- Catégorie
- Multimodal
- Entrée
- Texte, Image, Vidéo
- Sortie
- Texte
- Fenêtre de contexte
- 32 768 tokens
- Sortie max.
- 4 096 tokens
- Facturation
- À l'usage (tokens ou temps GPU)
- Entrée du catalogue mise à jour
- 23 septembre 2026
Étiquettes
- replicate
- multimodal
- vision-understanding
- open-weights
- small
Questions fréquemment posées
Qu'est-ce que MiniCPM-V 2.6 ?
MiniCPM-V 2.6 est un modèle de Community dans la catégorie Multimodal.
Combien coûte MiniCPM-V 2.6 sur Railwail ?
Sur Railwail, MiniCPM-V 2.6 coûte ≈ 0,0015 $US par exécution. Vous êtes facturé pour ce que chaque requête utilise réellement. L'utilisation est payée à partir de crédits prépayés ; 1 crédit équivaut à 0,01 $US.
Quelle est la fenêtre de contexte de MiniCPM-V 2.6 ?
La fenêtre de contexte de MiniCPM-V 2.6 contient 32 768 tokens. Une réponse peut faire jusqu'à 4 096 tokens.
Quelle est la vitesse de MiniCPM-V 2.6 ?
Il n'y a pas encore assez d'exécutions mesurées de MiniCPM-V 2.6 sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.
MiniCPM-V 2.6 est-il meilleur que BLIP ?
Cela dépend de la tâche. MiniCPM-V 2.6 (Community) et BLIP (Salesforce) sont tous deux des modèles de la catégorie Multimodal. La page de comparaison affiche leurs prix et spécifications côte à côte.
Comparer MiniCPM-V 2.6 et BLIPMiniCPM-V 2.6 peut-il traiter des images ?
Oui. MiniCPM-V 2.6 accepte les images en entrée en plus du texte.
Modèles comparables
Tous dans cette catégorie- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Tous les modèles via une API
Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.