vLLM: servindo LLMs no Linux com alta vazão — história, instalação e primeiros passos

vLLM: serving LLMs on Linux with high throughput — history, installation, and first steps

Se você já rodou um LLM local com Ollama ou llama.cpp, sabe que funciona muito bem — para uma ou duas pessoas. Quando a demanda vira uma API que precisa atender dezenas de requisições simultâneas, o jogo muda: a GPU fica ociosa esperando, a memória se fragmenta e a vazão despenca. É exatamente esse problema … Read more

Project Rainier: o data center de IA da AWS que roda sem NVIDIA

Project Rainier: o data center de IA da AWS que roda sem NVIDIA

Resumo em vídeo: este artigo é um resumo comentado — e checado — do vídeo “No Nvidia Chips Needed! Amazon’s New AI Data Center For Anthropic Is Truly Massive”, do canal CNBC, publicado em 29 de outubro de 2025. URL do vídeo: https://www.youtube.com/watch?v=vnGC4YS36gU Em outubro de 2025 a CNBC entrou, com câmera, no que viria … Read more

A história da NVIDIA

A história da NVIDIA

Em 1993, três engenheiros se reuniram numa lanchonete Denny’s na Califórnia para fundar uma empresa de chips gráficos num mercado que já tinha dezenas de concorrentes. Trinta anos depois, aquela empresa se tornaria — por vários momentos — a mais valiosa do planeta. Esta é a história da NVIDIA: dos flops que quase a mataram … Read more

AMD vence a Nvidia em todas as especificações — e mesmo assim perde

AMD vence a Nvidia em todas as especificações — e mesmo assim perde

Resumo em vídeo: este artigo é um resumo detalhado do vídeo “AMD Beats Nvidia On Every Spec And Still Loses”, do canal The Stack. URL do vídeo: https://www.youtube.com/watch?v=bOHhUVSDmrw No papel, a disputa nem deveria existir: o acelerador AMD MI300X carrega 192 GB de memória contra 80 GB do Nvidia H100, move 5,3 TB/s de banda … Read more

Hermes Agent: o agente de IA que aprende com você

Hermes Agent: o agente de IA que aprende com você

Agentes de IA que vivem no seu terminal viraram commodity — mas um agente que aprende com a própria experiência ainda é raridade. O Hermes Agent, da Nous Research, é exatamente isso: um agente open source (MIT, escrito em Python) com um ciclo de aprendizado embutido — ele cria habilidades a partir das tarefas que … Read more

Vibe coding no Linux: quatro skills de IA no CLI

Vibe coding no Linux: quatro skills de IA no CLI

Vibe coding no CLI é rápido até o agente esquecer o que vocês combinaram ontem, reler o repositório inteiro com grep e clicar no banner de cookies em vez do botão Salvar. Quatro ferramentas de código aberto — agent-browser, OpenSpec, codebase-memory-mcp e ai-memory — fecham exatamente esses buracos: o browser, o acordo antes do código, … Read more

A história de Elon Musk: do abismo ao império

A história de Elon Musk: do abismo ao império

Poucas figuras da tecnologia polarizam tanto quanto Elon Reeve Musk (Pretória, 28 de junho de 1971). Visionário de foguete reutilizável e carro elétrico para uns; gestor volátil e acionista-operador de um conglomerado (Tesla, SpaceX/SpaceXAI, Neuralink, X) para outros. Antes disso dormiu no chão de um escritório, perdeu o CEO do PayPal num avião e esteve … Read more

Google TPUs: arquitetura, gerações e modelos

Google TPUs: arquitetura, gerações e modelos

Por volta de 2013 o Google fez a conta que assustou Mountain View: se cada usuário Android usasse o comando de voz da Busca por três minutos ao dia, em CPU x86, a empresa teria de dobrar os data centers só para inferência. GPU de consumo ainda era placa de jogo adaptada. A resposta foi … Read more

Como a DeepSeek reescreveu o Transformer

Como a DeepSeek reescreveu o Transformer

Em janeiro de 2025 a DeepSeek soltou o R1 (e, semanas antes, o V3) competindo com o1 e GPT-4o em raciocínio — com uma fração do custo de treino e de inferência. Os pesos saíram abertos. O truque não é um truque de dataset: é uma reescrita do miolo do Transformer, o Multi-Head Latent Attention … Read more