IA

Nvidia PAIR une as GPUs do PC doméstico para agentes de IA duas vezes mais rápidos

Susan Hill

Um novo utilitário gratuito da Nvidia chamado PAIR — sigla em inglês para Roteador Pessoal de IA — distribui tarefas de agentes de IA entre vários computadores da sua rede doméstica, tratando sua coleção de PCs gamer, workstations e até Macs como um cluster de inferência unificado. A ideia é simples: a maioria dos computadores pesados para IA fica ociosa na maior parte do tempo, e as cargas de trabalho locais de IA estão cada vez mais baseadas em agentes que disparam dezenas de subtarefas independentes de uma só vez. O PAIR conecta esses ciclos sobressalentes.

O software funciona como um proxy transparente sobre o Ollama e o LM Studio, as duas ferramentas de inferência local mais populares, de modo que configurações existentes não exigem alteração de código. Instalado em cada máquina, o PAIR usa mDNS — o mesmo protocolo que sua impressora usa para aparecer na rede — para descobrir dispositivos compatíveis automaticamente. Um agente principal submete seu trabalho normalmente, e o PAIR decide qual máquina cuida de qual subtarefa com base nos modelos disponíveis em cada equipamento. Não é necessária configuração idêntica entre as máquinas: um PC gamer rodando Llama 3.3 e um notebook com Mistral podem cooperar na mesma tarefa.

O benchmark publicado pela Nvidia torna a diferença concreta: uma tarefa com cinco subagentes que levou 18 minutos em um único notebook RTX Spark terminou em 8 minutos e 48 segundos em um cluster de três dispositivos. Isso representa um ganho de aproximadamente 2× sem tocar em uma linha de código ou pagar por computação em nuvem. O ganho escala com o número de máquinas e a natureza da carga de trabalho — tarefas que se dividem em muitas partes paralelas são as mais beneficiadas.

Privacidade é o outro diferencial, e o mais duradouro. Cada prompt, arquivo e pedaço de contexto do agente permanece na sua rede doméstica. Nada é roteado para um serviço de inferência em nuvem; não há chave de API, medição de uso nem empresa alguma recebendo suas consultas. Para qualquer pessoa que execute agentes em documentos sensíveis — rascunhos jurídicos, anotações médicas, correspondência pessoal — essa distinção pesa mais que números de benchmark.

As ressalvas são reais. O PAIR não oferece qualidade de serviço garantida: se a máquina na qual você contava acordar a GPU para um jogo ou exportação de vídeo, o PAIR redistribui a carga de trabalho para o que estiver disponível. A ferramenta é abertamente projetada para tarefas de longa duração cujo prazo é flexível, não para aplicações nas quais a latência precisa ser previsível. Também é um software beta. A Nvidia está mirando entusiastas que tenham ao menos uma máquina compatível — uma placa GeForce RTX série 20 ou superior, ou silício Apple M4 — e que já saibam se virar com o Ollama.

O PAIR é gratuito, de código aberto e está disponível em beta agora para Windows, macOS e Linux. A Nvidia não anunciou um roteiro para garantias de QoS nem uma data de versão estável. O piso prático para usufruir dele são duas máquinas com hardware capaz, o que elimina a maioria das configurações de computador único. Para usuários que já rodam Ollama em mais de um dispositivo em casa, a barreira de entrada é baixa o suficiente para justificar o experimento.

Tags: , , , , ,

Discussão

Há 0 comentários.