Fornecimento de computação, GPUs, data centers e energia – a camada física que decide o custo de execução da IA.
Histórias 55
O fornecimento de computação, a energia e a capacidade do data center decidem o quão barato a IA pode funcionar. As mudanças na infraestrutura aparecem nos custos de inferência semanas depois.
A Patagônia argentina está chamando a atenção como um possível local para grandes data centers de IA. O artigo A Patagônia tem o que os data centers de IA desejam, incluindo nenhuma resistência até agora, apareceu pela primeira vez no The Decoder.
ASML conquistou Samsung, TSMC e Intel para mudar para máscaras fotográficas maiores, o que deve aumentar o rendimento de suas mais novas máquinas EUV em 40%. Enquanto isso, a Huawei está orquestrando a contra-estratégia da China, visando…
O mais novo modelo de previsão meteorológica de IA do Google prevê a velocidade do vento a 100 metros acima do solo, aproximadamente a altura de uma turbina eólica moderna. Ele também prevê a cobertura de nuvens e a quantidade de luz solar que atinge a superfície, e…
URL do artigo: https://newsroom.arm.com/blog/arm-mali-g2-ultra-nx-ai-native-mobile-graphics URL de comentários: https://news.ycombinator.com/item?id=49605511 Pontos: 43 # Comentários: 26
URL do artigo: https://www.bbc.com/news/articles/c0m39g7xzevo URL de comentários: https://news.ycombinator.com/item?id=49604956 Pontos: 15 # Comentários: 14
URL do artigo: https://www.ft.com/content/ea9a9dcc-b1df-49b0-b80c-f320161b9efa URL de comentários: https://news.ycombinator.com/item?id=49593778 Pontos: 18 # Comentários: 9
URL do artigo: https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html URL de comentários: https://news.ycombinator.com/item?id=49592508 Pontos: 15 # Comentários: 0
Os agentes de pesquisa em IA podem propor muito mais experimentos do que podem realizar. Meta FAIR, Oxford e UCL apresentam modelos de preferência de pesquisa de IA - juízes LLM congelados que classificam 15 candidatos não executados e executam apenas…
As pesquisas mostram que a esmagadora maioria dos americanos odeia data centers. A China é um bode expiatório perfeito para os líderes tecnológicos e seus aliados – o único problema é a falta de provas.
A qualidade da recuperação em um produto de pesquisa de IA é limitada por duas coisas: quão bom é o modelo de incorporação e quão barato você pode executá-lo em um índice. Esta semana, a equipe da Perplexity Engineering publicou Fast Embeddings no GP…
A Nous Research reduziu a configuração do modelo local em um único clique no Hermes Desktop. O aplicativo lê seu hardware, verifica o catálogo em relação à sua GPU, escolhe a versão da mais alta qualidade adequada, faz o download e con…
A Deepseek quer colocar 160.000 chips Huawei Ascend-950DT em um data center da Mongólia Interior apenas para inferência, não para treinamento. Seria o maior cluster de chips Huawei conhecido. Mas gargalos de produção significam problemas da Huawei…
Faltam menos de 24 horas para se inscrever para sediar um evento paralelo durante o TechCrunch Disrupt 2026 e deixar sua marca no cenário do Vale do Silício. Inscreva-se antes que o aplicativo feche hoje à meia-noite, horário do Pacífico.
O hub HomeAgent H100 Pro da Ugreen combina armazenamento local, IA no dispositivo e um novo assistente de voz, Uliya, para administrar sua casa inteligente. | Foto de Jennifer Pattison Tuohy / The Verge Ugreen, conhecida por seus bancos de energia para telefones, cha…
O PAIR (Personal AI Router) da Nvidia distribui automaticamente solicitações locais de IA por todos os dispositivos disponíveis em uma rede doméstica, reduzindo o tempo de espera para tarefas de agentes paralelos. O artigo Nvidia quer que sua rede doméstica funcione…
A Perplexity lançou computação híbrida para seu aplicativo Mac, dividindo uma única tarefa do Perplexity Computer entre modelos de fronteira na nuvem e um modelo compacto em execução na máquina do usuário. As tarefas começam na nuvem para o mar…
A Nvidia está anunciando seu novo Personal AI Router (PAIR), uma ferramenta gratuita que sincroniza seus computadores domésticos para lidar com tarefas locais de inferência de IA com ferramentas como Ollama e LM Studio. Vamos tirar o óbvio do caminho…
Sam Altman alerta sobre “tolices insustentáveis” na construção global de data centers de IA. Muitos provedores de Neocloud estão anunciando capacidade massiva sem que os clientes façam backup. Ele também admite que a queda da computação…
O Presidente Trump tem resistido fortemente à crescente oposição aos centros de dados de IA nos EUA. O artigo Protestos contra data centers de IA fazem o jogo da China, diz Trump, apareceu pela primeira vez no The Decoder.
Há pouco mais de uma década, liderei o projeto de controles de um sistema de controle totalmente digital, o primeiro de seu tipo, para uma usina nuclear dos EUA. Era, no papel, uma bela máquina – projetada para funcionar sozinha da mesma forma que uma companhia aérea moderna…
A maioria das pilhas de voz de produção são três sistemas interligados. Um modelo transcreve, um segundo separa os alto-falantes e um detector decide quando o usuário parou de falar. Cada transferência adiciona latência e um novo mo…
Os assistentes agentes têm um problema estrutural: o contexto que os torna úteis – documentos de negócios, arquivos privilegiados, registros de clientes – é exatamente o contexto que os usuários não podem enviar para um endpoint na nuvem. Esta semana, Perplexidade s…
Se você possui um servidor doméstico, um computador para jogos ou apenas um laptop que não gosta muito, ouça. Agora você pode usar esse poder de computação extra e ganhar alguma renda passiva no processo. As empresas de IA são hu…
A Nvidia está lançando oficialmente o DLSS 5 esta semana, após um anúncio polêmico em março, onde comparamos a tecnologia de upscaling de IA a um “filtro de IA generativo em tempo real para videogames” e “suavização de movimento para videogames”.
Os agentes de voz falham na latência muito antes de falharem na inteligência. O tempo até o primeiro token é a métrica que a maioria das equipes usa para escolher uma API de inferência e é o ponto de partida certo e o ponto de parada errado. Este banco…
A empresa está testando robôs em tarefas que podem ser executadas por técnicos.
A nova geração de sistemas de data center está aumentando a eficiência com um controle de tráfego mais inteligente, em vez de apenas mais ciclos de processador.
O gravador de voz Comulytic Note Pro AI reúne muita potência em um dispositivo do tamanho de um cartão de crédito. Mas a sua utilidade depende de você.
No momento em que os novos centros de dados enfrentam uma reação crescente por parte das comunidades vizinhas, a Agência de Proteção Ambiental dos EUA (EPA) está prestes a tornar mais difícil para as pessoas avaliarem qualquer poluição que esses centros criem. A EPA…
A empresa está testando robôs que podem trocar cabos, reiniciar servidores e realizar outras tarefas executadas por técnicos, alimentando preocupações entre alguns trabalhadores de que seus empregos possam estar em risco.
A indústria tecnológica está perplexa com o plano de Trump de vencer a corrida da IA ao taxar os centros de dados.
A IA de fala auto-hospedada traz uma compensação de observabilidade: os números que impulsionam o planejamento de capacidade e o gerenciamento de custos permanecem trancados dentro do contêiner do fornecedor. Deepgram preenche essa lacuna no Amazon SageMaker AI com dois ca…
Servir modelos de reconhecimento automático de fala (ASR) em escala é caro quando cada solicitação usa apenas uma fração de uma GPU. Saiba como NVIDIA CUDA Multi-Process Service (MPS) com NVIDIA Triton Inference Server no Amazon EC2 G…
O Google está estabelecendo novos limites de uso de memória para aplicativos Android, à medida que os data centers de IA contribuem para a escassez de hardware que pode deixar os telefones de baixo custo com menos memória.
Hoje no Decoder, estou conversando com o repórter sênior de IA da Verge, Hayden Field, sobre algumas iscas puras do Decoder: as mudanças aparentemente infinitas no organograma da OpenAI e como todas elas parecem consolidar o poder sob o comando do cofundador Greg…
Você tem dúvidas sobre data centers e a WIRED tem as respostas. Participe da nossa transmissão ao vivo no dia 10 de setembro e nosso painel de especialistas contará tudo o que você precisa saber.
O novo Gemini 3.5 Transcribe do Google reconhece mais de 85 idiomas, elimina palavras de preenchimento e corrige lapsos de língua em tempo real. Ele atinge uma taxa de erro de palavras de 4,0% no modo streaming, com latência 70% menor…
A Amazon adicionará mais 2 milhões de chips GPU Nvidia aos seus data centers nos próximos dois anos. Mas esta parceria ampliada vai além da compra de mais chips.
A próxima vaga de IA está a colocar novas exigências à infraestrutura. À medida que os agentes de IA e as cargas de trabalho de trilhões de parâmetros se tornam predominantes, o desempenho da infraestrutura de IA depende não apenas da computação, mas de como a computação, a memória…
O SageMaker Python SDK v3 redesenha o modo de script com classes ModelTrainer e ModelBuilder unificadas. Esta postagem aborda dois exemplos completos, um Random Forest scikit-learn e um Stable Diffusion 3.5 Lo multi-GPU…
Não se pode tratar apenas de colher energia solar – trata-se também de armazenamento e de transferir energia barata e fora de pico para horários em que é mais cara.
Em comunicado ao TechCrunch sobre a saída de Malone, a OpenAI disse que “reorganizou recentemente” sua “organização de infraestrutura para apoiar a escala e o ritmo de nosso trabalho”.
URL do artigo: https://www.wsj.com/tech/ai/openais-head-of-data-centers-has-left-company-6d24fd83 URL de comentários: https://news.ycombinator.com/item?id=49439489 Pontos: 27 # Comentários: 9
A OpenAI interrompeu uma campanha secreta de influência russa que usava o ChatGPT para gerar postagens nas redes sociais ao banir um conjunto de contas. As operadoras acessaram a plataforma através de VPNs da Rússia e promoveram o f…
A OpenAI exibiu o “Jalapeño”, seu primeiro chip de inferência interno, com benchmarks na conferência Hot Chips. De acordo com os testes SemiAnalysis, o chip supera o Blackwell da Nvidia e até mesmo o Rubin em rendimento e consumo de energia…
Treinar e servir modelos de fronteira é agora um problema de rede tanto quanto de computação. Operações coletivas como all-reduce e all-to-all sincronizam milhares de aceleradores durante o treinamento, e as mais lentas…
O Mac Studio com o M5 Ultra contará com incríveis 512 GB de memória unificada e terá até oito monitores externos.
Testado no benchmark InferenceX da SemiAnalysis, o Jalapeño registrou mais tokens por usuário e mais rendimento por quilowatt do que o estado da arte atualmente disponível.
A OpenAI afirma que seu novo chip de IA, Jalapeño, conclui tarefas com mais eficiência e retorna respostas mais rapidamente do que outros sistemas de IA, de acordo com uma postagem de blog publicada na terça-feira. Durante um briefing com repórteres, o hardware OpenAI…
Article URL: https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute/ Comments URL: https://news.ycombinator.com/item?id=49433292 Points: 443 # Comments: 364
Nvidia is moving its Groq 3 LPX inference chip into full production and reports 3,400 tokens per second on Gemma 4 31B, four times faster than Cerebras. But the numbers don't tell the whole story. Nvidia needs at least…
OpenAI CFO Sarah Friar explains how advances across chips, compute, models, and products compound to deliver more useful intelligence at greater scale and lower cost.
Jalapeño is a custom inference chip from OpenAI that delivers faster, more power-efficient AI inference, with higher throughput and lower latency for modern models.
O Amazon SageMaker HyperPod agora oferece suporte gerenciado ao Ray no Amazon EKS. Crie e monitore clusters Ray, conecte notebooks JupyterLab e Code Editor a clusters ativos, obtenha observabilidade pronta para uso e execute operações resilientes…
A próxima era de inferência de IA não será definida por um único chip, rede ou sistema inovador. Será definido pela forma como cada camada da fábrica de IA funciona em conjunto. É por isso que a NVIDIA está estendendo o Vera Rubin NVL72 com…
Os resumos são agregados apenas para fins informativos – siga o link da fonte para ver a história completa. As entradas de demonstração são ilustrativas.