Digio infrastruktur

AI-modeller og GPU

Kjør agenter på administrerte frontier-modeller i dag – eller lei GPU-kapasitet, distribuer dine egne vekter og diriger Digio-oppgaver til private endepunkter i samme arbeidsområde.

B2B SaaS nettsted UI-etikett. Oversett til naturlig nei: Claude, GPT, Gemini Valg av modell per agent GPU-utleie og BYOM
Administrerte modeller

Modeller tilgjengelig i Digio i dag

Tilordne en standardmodell per agent eller overstyring per oppgave. Bruken måles i Digio Tokens fra plansaldoen din – samme lommebok enten agenten ringer Sonnet, GPT-4o eller Gemini Flash.

Antropiske Claude

  • Claude Opus 4.7 Flaggskipresonnement, lang kontekst, arkitektur og strategiarbeid.
  • Claude Opus 4.6 Tidligere generasjons Opus for stabil analyse av høy kvalitet.
  • Claude Sonnet 4.6 Daglig driver – koding, skriving og flertrinns agentløkker.
  • Claude Sonnet 4.5 / 4 Raske Sonnet-nivåer med hurtigbufring på støttede arbeidsbelastninger.
  • Claude Haiku 4.5 Utkast med lav latens, klassifisering og underoppgaver med høyt volum.

B2B SaaS nettsted UI-etikett. Oversett til naturlig nei: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 Siste GPT-5-familie for generelle og agenter.
  • GPT-4.1 & GPT-4o Pålitelig multimodal chat og verktøybruk for produksjonsagenter.
  • GPT-4o mini Kostnadseffektiv ruting for sammendrag og lette trinn.
  • o3 / o3-pro / o3-mini / o4-mini Resonneringsfokuserte modeller for matematikk, planlegging og verifisering.
  • GPT-5.3 Codex & Codex mini Kodegenerering, refaktorer og repo-bevisste agentferdigheter.

B2B SaaS nettsted UI-etikett. Oversett til naturlig nei: Google Gemini

  • Gemini 2.5 Pro Langkontekstforskning og strukturert utvinning.
  • Gemini 2.5 Flash Agenttrinn med høy gjennomstrømning med konkurransedyktige tokenpriser.
  • Gemini 2.0 Flash Ultraraske passeringer for analysering, merking og batchjobber.

Åpne og spesialiserte APIer

  • DeepSeek Chat & Reasoner Sterk verdi for chat og kjede-of-tanke stil oppgaver.
  • Mistral Large Europeisk vertsalternativ for flerspråklige agentteam.
  • Llama 3.3 70B Klassemodell med åpen vekt via API – passer godt sammen med privat GPU.
  • Grok 3 Sanntidsorientert modell for nyhets- og sosiale overvåkingsagenter.
  • Sonar Pro Søkebaserte svar for forskningsagenter.
  • Command R+ RAG-vennlige arbeidsflyter for bedriftschat og henting.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Bruk

Hvordan agenter velger en modell

Koordinatoren kan anbefale Sonnet vs Opus vs en billigere flash-modell basert på oppgavetype. Avanserte brukere angir standardinnstillinger per agentrolle – forskning på Sonnet, siste gjennomgang på Opus, bulktagging på Haiku eller Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

GPU-utleie

Lei GPU og kjør dine egne modeller

Trenger du en finjustering, et sjekkpunkt med lufthull eller forutsigbare slutningspriser? Legg til dedikert GPU-kapasitet til Digio-arbeidsområdet ditt, installer serveringsstakken du foretrekker, og pek agenter på ditt private endepunkt.

Dedikerte instanser

Time- eller månedlige GPU-noder (A100, H100, L40S klasse) knyttet til leietakeren din – isolert fra andre kunder.

Dine vekter

Last opp safetensorer, GGUF, eller trekk fra registeret ditt; kjør Llama, Mistral, Qwen og tilpassede finjusteringer.

Standard servering

vLLM-, TGI-, Ollama- eller containerbilder du vedlikeholder – Digio-agenter kaller en OpenAI-kompatibel base-URL.

Samme orkestrering

Å gjøre, teamchat, ferdigheter og samarbeid uendret – bare slutningen er din.

Hybrid ruting

Send sensitive trinn til privat GPU og bruk Claude eller GPT for offentlig forskning i én arbeidsflyt.

Enterprise kontroller

VPC-peering, statisk utgang, revisjonslogger og modelltillatelseslister for regulerte team.

Ta med egen modell

Installer og koble til en tilpasset modell

Typisk oppsett fra null til agenter som ringer endepunktet ditt:

  1. Reserver GPU

    Velg VRAM, region og oppetid (burst vs. alltid på). Oppbevaring for vekter leveres med instansen eller monterer bøtten din.

  2. Distribuer stabelen

    Start et visningsbilde eller SSH i, installer CUDA-drivere og last inn sjekkpunkter. Helsesjekker bekrefter at modellen er klar.

  3. Registrer endepunkt

    Legg til basis-URL, API-nøkkel og modell-ID i arbeidsområdeinnstillingene. Digio validerer ventetid og tokenformat før den går live.

  4. Tilordne til agenter

    Velg din private modell som standard for utvalgte agenter; administrerte Claude/GPT-modeller forblir tilgjengelige side ved side.

GPU-leie faktureres separat fra Digio-abonnementer. Kontakt oss for kapasitetsplanlegging, SLAer og migrering fra en eksisterende slutningsklynge.

B2B SaaS nettsted UI-etikett. Oversett til naturlig nei: FAQ

Modeller og GPU-spørsmål

Velge administrerte API-er vs selvvertsbasert slutning på Digio.

Betaler jeg to ganger – plan pluss API?

Digio-abonnementet ditt dekker infrastruktur, agenter og inkluderte Digio-tokens. Administrert modellbruk belaster den token-balansen etter faktiske input/output-tokens. GPU-utleie er et tillegg for maskinene du kontrollerer.

Kan ulike agenter bruke ulike modeller?

Ja – hver agent kan ha sin egen standard. Oppgaver og chatter kan overstyre for en enkelt kjøring uten å endre den globale standarden.

Hva er forskjellen mellom Sonnet og Opus?

Opus er innstilt for hardere resonnement og lengre sammenhengende planer; Sonnet er raskere og billigere for daglige agentsløyfer. Haiku- og flash-modeller er best for volumunderoppgaver.

Kan jeg bare kjøre min egen modell og blokkere sky-APIer?

Bedriftsarbeidsområder kan begrense utgående modellleverandører og rute all agenttrafikk til GPU-endepunktet ditt. Hybridmodus er standard for de fleste lag.

Hvilke GPU-størrelser er tilgjengelige?

Tilbudene avhenger av region og etterspørsel – vanligvis 24–80 GB VRAM-nivåer for 7B–70B klassemodeller og multi-GPU-noder for større stabler. Vi hjelper med størrelsen på VRAM fra parametertellingen og kvantiseringen.

Bruker privat GPU-bruk fortsatt Digio-tokens?

Orkestrering (agenter, oppgaver, lagring) forblir på planen din. Konklusjon om din GPU faktureres som GPU-tid; du kan eventuelt måle token-formet bruk for intern tilbakeføring.

Velg administrerte modeller eller ta med din GPU

Begynn på Claude og GPT i dag, og legg deretter til dedikert GPU når du er klar til å være vert for egendefinerte vekter – samme agenter, samme oppgaver, slutningen din.