Gemini 1.5 Pro (vision)

MultimodalUdgåetIkke tilgængelig
af Google DeepMindModell-ID: gemini-1-5-pro-vision

Google Gemini 1.5 Pro with native multimodal input. Reads images, long PDFs, audio and video in up to a 2M-token context, useful for whole-document and long-video understanding.

Status
Ikke tilgængelig
Kontekst
2.097.152 tokens
Maks. output
8.192 tokens
Input → output
Tekst + Billede + Lyd + Video → Tekst
Udvikler
Google DeepMind
Opdateret
23. september 2026

Gemini 1.5 Pro (vision) er i øjeblikket utilgængelig

Du kan stadig læse detaljerne på denne side. Vælg en af de tilgængelige alternativer nedenfor for at køre en sammenlignelig model med det samme.

Gå til alternativer

Udbyderen har udfaset denne model.

01

Sammenlignelige modeller

Alle i denne kategori
02

Playground

Prøv Gemini 1.5 Pro (vision)

Chat

Derzeit nicht verfügbar

Ikke tilgængelig i øjeblikket.

Playground'en er deaktiveret. Du finder sammenlignelige modeller i samme kategori: Se alternativer

Prøv Gemini 1.5 Pro (vision)

Send en besked. Svaret ankommer fuldt ud, når modellen er færdig (uden streaming).

Maks. svarslængde (tokens)

Denne kørsel

Ingen pris – ikke tilgængelig i øjeblikket.

Ny her?

10 gratis credits (0,10 US$) når du tilmelder dig med Google

Kan bruges 24 timer efter tilmelding, op til 5 kørsler pr. dag og højst 2 credits pr. kørsel. Andre login-metoder starter uden credits.

03

Om Gemini 1.5 Pro (vision)

Kort sagtFra 23. september 2026

Gemini 1.5 Pro (vision) er en model af Google DeepMind i kategorien Multimodal. Gemini 1.5 Pro (vision) er i øjeblikket ikke tilgængelig på Railwail. Kontekstvinduet indeholder 2.097.152 tokens, og et svar kan være op til 8.192 tokens langt.

Gemini 1.5 Pro accepts text, images, audio and video tokens in a single pass with a context window up to 2M tokens. That lets it ingest entire PDFs, hour-long videos or large image sets and answer questions across them. Common uses: long-document visual QA, video summarization and frame-level analysis, and mixed media extraction. Function calling and JSON output are first-class via the Gemini API.
04

Priser

Ikke tilgængelig i øjeblikket. Der er i øjeblikket ingen pris for denne model, så den kan ikke køres.

05

API

Kald Gemini 1.5 Pro (vision) med din Railwail API-nøgle. Brug dette model-ID i anmodningen:

I øjeblikket utilgængelig

Modellen har ingen bekræftet pris eller er deaktiveret; API-kald afvises.

06

Specifikationer

Model-ID
gemini-1-5-pro-vision
Kategori
Multimodal
Input
Tekst, Billede, Lyd, Video
Output
Tekst
Kontekstvindue
2.097.152 tokens
Maks. output
8.192 tokens
Livscyklus
Udgået
Katalogelement opdateret
23. september 2026

Inputparametre

Inputs og indstillinger fra modellens inputskema. Eksemplet i API-afsnittet viser, hvilke af dem API'en accepterer.

  • promptpåkrævet

    Question or instruction about the media

    Type: Tekst
    Standard: –
    Tilladte værdier: op til 32.000 tegn
  • top_p
    Type: Tal
    Standard: 0.95
    Tilladte værdier: 0 til 1
  • stream
    Type: Ja/Nej
    Standard: false
    Tilladte værdier: –
  • image_url

    Image, PDF or video URL to analyze

    Type: Tekst
    Standard: –
    Tilladte værdier: –
  • max_tokens
    Type: Heltal
    Standard: 2048
    Tilladte værdier: 1 til 8.192
  • temperature
    Type: Tal
    Standard: 1
    Tilladte værdier: 0 til 2
  • system_prompt

    Optional system instruction

    Type: Tekst
    Standard: –
    Tilladte værdier: op til 8.000 tegn

Tags

  • google
  • gemini
  • vision
  • multimodal
  • long-context
  • video-understanding
07

Ofte stillede spørgsmål

Hvad er Gemini 1.5 Pro (vision)?

Gemini 1.5 Pro (vision) er en model fra Google DeepMind i kategorien Multimodal. Den er opført på Railwail, men kan ikke køres i øjeblikket.

Hvad koster Gemini 1.5 Pro (vision) på Railwail?

Gemini 1.5 Pro (vision) kan ikke køres på Railwail i øjeblikket, så der er ingen aktuel pris. Tilgængelige alternativer med priser er angivet længere nede på denne side.

Hvad er kontekstvinduet for Gemini 1.5 Pro (vision)?

Kontekstvinduet for Gemini 1.5 Pro (vision) indeholder 2.097.152 tokens. Et svar kan være op til 8.192 tokens langt.

Hvor hurtig er Gemini 1.5 Pro (vision)?

Der er endnu ikke nok målte kørsler af Gemini 1.5 Pro (vision) på Railwail til at angive en udførelsestid. Det afhænger af inputtet, indstillingerne og belastningen hos provideren.

Er Gemini 1.5 Pro (vision) bedre end BLIP?

Det afhænger af opgaven. Gemini 1.5 Pro (vision) (Google DeepMind) og BLIP (Salesforce) er begge modeller i kategorien Multimodal. Sammenligningssiden viser deres priser og specifikationer side om side.

Sammenlign Gemini 1.5 Pro (vision) og BLIP

Kan Gemini 1.5 Pro (vision) behandle billeder?

Ja. Gemini 1.5 Pro (vision) accepterer billeder som input ud over tekst.

Kan jeg bruge Gemini 1.5 Pro (vision) lige nu?

Ikke tilgængelig i øjeblikket. Siden forbliver online; tilgængelige alternativer fra samme kategori er angivet længere nede.

Alle modeller via én API

En API-nøgle til alle modeller på Railwail. Forbrug debiteres fra forudbetalte credits, 1 credit = 0,01 US$.