Gemini 1.5 Pro (vision)
gemini-1-5-pro-visionGoogle Gemini 1.5 Pro with native multimodal input. Reads images, long PDFs, audio and video in up to a 2M-token context, useful for whole-document and long-video understanding.
- Statut
- Non disponible
- Contexte
- 2.097.152 tokens
- Max. sortie
- 8.192 tokens
- Entrée → Sortie
- Texte + Image + Audio + Vidéo → Texte
- Développeur
- Google DeepMind
- Mis à jour
- 23 septembre 2026
Gemini 1.5 Pro (vision) n'est actuellement pas disponible
Vous pouvez toujours consulter les détails sur cette page. Choisissez l'une des alternatives disponibles ci-dessous pour exécuter immédiatement un modèle comparable.
Voir les alternativesLe fournisseur a retiré ce modèle.
Modèles comparables
Tous dans cette catégorie- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
≈ 0,00030 $US/exécution
Comparer Gemini 1.5 Pro (vision) et BLIP - Claude Opus 4.7Anthropic
Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.
6,00 $US/1M entrée
Comparer Gemini 1.5 Pro (vision) et Claude Opus 4.7 - Claude Sonnet 4.6Anthropic
Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.
3,60 $US/1M entrée
Comparer Gemini 1.5 Pro (vision) et Claude Sonnet 4.6
Playground
Essayer Gemini 1.5 Pro (vision)
Chat
Actuellement indisponible.
Le playground est désactivé. Vous pouvez trouver des modèles comparables dans la même catégorie : Parcourir les alternatives
Cette exécution
Pas de prix – actuellement indisponible.
Nouveau par ici ?
10 crédits gratuits (0,10 $US) lors de l'inscription avec Google
Utilisable 24 heures après l'inscription, jusqu'à 5 exécutions par jour et au maximum 2 crédits par exécution. Les autres méthodes de connexion commencent sans crédits.
À propos de Gemini 1.5 Pro (vision)
Gemini 1.5 Pro (vision) est un modèle de Google DeepMind dans la catégorie Multimodal. Gemini 1.5 Pro (vision) n'est actuellement pas disponible sur Railwail. La fenêtre de contexte contient 2.097.152 tokens, et une réponse peut faire jusqu'à 8.192 tokens.
Tarification
Actuellement indisponible. Il n'y a actuellement pas de prix pour ce modèle, il ne peut donc pas être exécuté.
API
Actuellement indisponible
Le modèle n'a pas de prix vérifié ou est désactivé ; les appels API sont refusés.
Spécifications
- ID du modèle
gemini-1-5-pro-vision- Développeur
- Google DeepMind
- Catégorie
- Multimodal
- Entrée
- Texte, Image, Audio, Vidéo
- Sortie
- Texte
- Fenêtre de contexte
- 2.097.152 tokens
- Sortie max.
- 8.192 tokens
- Cycle de vie
- Retiré
- Entrée du catalogue mise à jour
- 23 septembre 2026
Paramètres d'entrée
Entrées et paramètres du schéma d'entrée du modèle. L'exemple dans la section API montre lesquels l'API accepte.
promptObligatoireQuestion or instruction about the media
Type: TexteDéfaut: –Valeurs autorisées: jusqu'à 32.000 caractèrestop_pType: NombreDéfaut:0.95Valeurs autorisées: 0 à 1streamType: Oui/NonDéfaut:falseValeurs autorisées: –image_urlImage, PDF or video URL to analyze
Type: TexteDéfaut: –Valeurs autorisées: –max_tokensType: Nombre entierDéfaut:2048Valeurs autorisées: 1 à 8.192temperatureType: NombreDéfaut:1Valeurs autorisées: 0 à 2system_promptOptional system instruction
Type: TexteDéfaut: –Valeurs autorisées: jusqu'à 8.000 caractères
Étiquettes
- gemini
- vision
- multimodal
- long-context
- video-understanding
Questions fréquemment posées
Qu'est-ce que Gemini 1.5 Pro (vision) ?
Gemini 1.5 Pro (vision) est un modèle de Google DeepMind dans la catégorie Multimodal. Il est listé sur Railwail mais ne peut pas être exécuté pour le moment.
Combien coûte Gemini 1.5 Pro (vision) sur Railwail ?
Gemini 1.5 Pro (vision) ne peut pas être exécuté sur Railwail pour le moment, il n'y a donc pas de prix actuel. Les alternatives disponibles avec leurs prix sont listées plus bas sur cette page.
Quelle est la fenêtre de contexte de Gemini 1.5 Pro (vision) ?
La fenêtre de contexte de Gemini 1.5 Pro (vision) contient 2.097.152 tokens. Une réponse peut faire jusqu'à 8.192 tokens.
Quelle est la vitesse de Gemini 1.5 Pro (vision) ?
Il n'y a pas encore assez d'exécutions mesurées de Gemini 1.5 Pro (vision) sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.
Gemini 1.5 Pro (vision) est-il meilleur que BLIP ?
Cela dépend de la tâche. Gemini 1.5 Pro (vision) (Google DeepMind) et BLIP (Salesforce) sont tous deux des modèles de la catégorie Multimodal. La page de comparaison affiche leurs prix et spécifications côte à côte.
Comparer Gemini 1.5 Pro (vision) et BLIPGemini 1.5 Pro (vision) peut-il traiter des images ?
Oui. Gemini 1.5 Pro (vision) accepte les images en entrée en plus du texte.
Puis-je utiliser Gemini 1.5 Pro (vision) maintenant ?
Actuellement indisponible. La page reste en ligne ; les alternatives disponibles de la même catégorie sont listées plus bas.
Tous les modèles via une API
Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.