Infraestrutura Digio

Modelos de IA e GPU

Execute agentes em modelos de fronteira geridos hoje mesmo — ou alugue capacidade de GPU, implemente os seus próprios pesos e reencaminhe tarefas Digio para endpoints privados no mesmo espaço de trabalho.

Claude, GPT, Gémeos Escolha do modelo por agente Aluguer de GPU e BYOM
Modelos geridos

Modelos disponíveis no Digio hoje

Atribua um modelo padrão por agente ou substitua por tarefa. A utilização é medida em Digio Tokens a partir do saldo do seu plano – a mesma carteira, quer o agente ligue para a Sonnet, GPT-4o ou Gemini Flash.

Claude antrópico

  • Claude Opus 4.7 Raciocínio emblemático, contexto longo, trabalho de arquitetura e estratégia.
  • Claude Opus 4.6 Opus da geração anterior para análises estáveis ​​e de alta qualidade.
  • Claude Sonnet 4.6 Driver diário – codificação, escrita e loops de agente de várias etapas.
  • Claude Sonnet 4.5 / 4 Camadas Fast Sonnet com cache imediata nas cargas de trabalho suportadas.
  • Claude Haiku 4.5 Rascunhos de baixa latência, classificação e subtarefas de alto volume.

Rótulo da interface do utilizador do site SaaS B2B. Traduzir para pt natural: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 A mais recente família GPT-5 para cargas de trabalho gerais e de agentes.
  • GPT-4.1 & GPT-4o Chat multimodal fiável e utilização de ferramentas para agentes de produção.
  • GPT-4o mini Encaminhamento económico para resumos e etapas leves.
  • o3 / o3-pro / o3-mini / o4-mini Modelos focados no raciocínio para a matemática, planeamento e verificação.
  • GPT-5.3 Codex & Codex mini Geração de código, refactorings e competências de agente com reconhecimento de repositório.

Google Gémeos

  • Gemini 2.5 Pro Investigação de longo contexto e extração estruturada.
  • Gemini 2.5 Flash Etapas de agente de alto rendimento com taxas de token competitivas.
  • Gemini 2.0 Flash Passagens ultrarrápidas para análise, marcação e trabalhos em lote.

APIs abertas e especializadas

  • DeepSeek Chat & Reasoner Forte valor para tarefas de chat e estilo de cadeia de pensamento.
  • Mistral Large Opção alojada na Europa para equipas de agentes multilingues.
  • Llama 3.3 70B Modelo de classe de pesos abertos via API – combina bem com GPU privado.
  • Grok 3 Modelo orientado em tempo real para agentes de notícias e monitorização social.
  • Sonar Pro Respostas baseadas em inquéritos para agentes de investigação.
  • Command R+ Fluxos de trabalho de recuperação e chat empresarial compatíveis com RAG.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Uso

Como os agentes escolhem um modelo

O Coordenador pode recomendar Sonnet vs Opus vs um modelo flash mais barato com base no tipo de tarefa. Os utilizadores avançados definem os padrões por função de agente: pesquisa no Sonnet, revisão final no Opus, marcação em massa no Haiku ou Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

Aluguer de GPU

Alugue GPU e execute os seus próprios modelos

Precisa de um ajuste fino, de um ponto de verificação isolado ou de preços de inferência previsíveis? Adicione capacidade de GPU dedicada ao seu espaço de trabalho Digio, instale a pilha de serviços da sua preferência e aponte os agentes para o seu endpoint privado.

Instâncias dedicadas

Nós GPU por hora ou por mês (classe A100, H100, L40S) anexados ao seu tenant, isolados de outros clientes.

Os seus pesos

Faça o upload de safetensors, GGUF ou extraia do seu registo; execute Llama, Mistral, Qwen e ajustes finos personalizados.

Porção padrão

vLLM, TGI, Ollama ou imagens de contentor que mantém – os agentes Digio chamam um URL base compatível com OpenAI.

Mesma orquestração

Para o fazer, o chat em equipa, as competências e a colaboração permanecem inalterados – apenas o back-end de inferência é seu.

Roteamento híbrido

Envie etapas confidenciais para GPU privada e utilize Claude ou GPT para pesquisas públicas num único fluxo de trabalho.

Controles empresariais

peering VPC, saída estática, registos de auditoria e listas de permissões de modelos para equipas reguladas.

Traga o seu próprio modelo

Instalar e ligar um modelo personalizado

Configuração típica de zero até agentes que ligam para o seu endpoint:

  1. Reservar GPU

    Escolha VRAM, região e tempo de atividade (intermitente versus sempre ativo). O armazenamento para os pesos é enviado com a instância ou montado no seu bucket.

  2. Implantar a pilha

    Inicie uma imagem de serviço ou SSH, instale controladores CUDA e carregue pontos de verificação. As verificações de integridade confirmam que o modelo está pronto.

  3. Registar endpoint

    Adicione URL base, chave API e ID do modelo nas definições do espaço de trabalho. Digio valida a latência e o formato do token antes de entrar em funcionamento.

  4. Atribuir aos agentes

    Escolha o seu modelo privado como padrão para os agentes selecionados; os modelos Claude/GPT geridos permanecem disponíveis lado a lado.

O aluguer da GPU é cobrado separadamente das subscrições do plano Digio. Contacte-nos para planeamento de capacidade, SLAs e migração de um cluster de inferência existente.

Perguntas frequentes

Questões sobre modelos e GPU

Escolhendo APIs geridas versus inferência auto-hospedada no Digio.

Pago duas vezes – plano mais API?

A sua subscrição Digio cobre a infraestrutura, agentes e Digio Tokens incluídos. Débitos de utilização do modelo gerido que são equilibrados por tokens de entrada/saída reais. O aluguer de GPU é um complemento às máquinas que controla.

Diferentes agentes podem usar modelos diferentes?

Sim, cada agente pode ter o seu próprio padrão. As tarefas e os chats podem ser substituídos numa única execução sem alterar o padrão global.

Qual a diferença entre Soneto e Opus?

O Opus está sintonizado para raciocínios mais difíceis e planos mais coerentes; O Sonnet é mais rápido e mais barato para loops diários de agentes. Os modelos Haiku e da classe flash são melhores para subtarefas de volume.

Posso executar apenas o meu próprio modelo e bloquear APIs de cloud?

Os espaços de trabalho empresariais podem restringir os fornecedores de modelos de saída e encaminhar todo o tráfego do agente para o endpoint da GPU. O modo híbrido é o padrão para a maioria das equipas.

Que tamanhos de GPU estão disponíveis?

As ofertas dependem da região e da procura – geralmente níveis de VRAM de 24 a 80 GB para modelos de classe 7B a 70B e nós multi-GPU para pilhas maiores. Ajudamos a dimensionar a VRAM a partir da contagem e quantização de parâmetros.

O uso privado de GPU ainda consome Digio Tokens?

A orquestração (agentes, tarefas, armazenamento) mantém-se no seu plano. A inferência na sua GPU é cobrada como tempo de GPU; opcionalmente, pode medir a utilização em formato de token para estorno interno.

Escolha modelos geridos ou traga a sua GPU

Comece hoje mesmo com o Claude e o GPT e, em seguida, adicione GPU dedicada quando estiver pronto para alojar pesos personalizados — os mesmos agentes, as mesmas tarefas, a sua inferência.