Fornitura di elaborazione, GPU, data center ed energia: il livello fisico che decide quanto a buon mercato viene eseguita l'intelligenza artificiale.
Storie 45
L’offerta di elaborazione, l’energia e la capacità dei data center determinano quanto a buon mercato può funzionare l’intelligenza artificiale. I cambiamenti infrastrutturali si manifestano nei costi di inferenza settimane dopo.
NVIDIA sta utilizzando Palantir Foundry e cuOpt per automatizzare le decisioni relative all'allocazione della catena di fornitura hardware nei siti di produzione globali. L'azienda misura la consegna operativa dal wafer-out al primo token. Questo vento…
URL dell'articolo: https://system76.com/workstations/thelio-mira-ai URL dei commenti: https://news.ycombinator.com/item?id=49651372 Punti: 18 # Commenti: 9
Amazon SageMaker Inference ora offre routing con riconoscimento del prefisso, una strategia di routing che invia richieste che condividono lo stesso prefisso di prompt alla stessa istanza in modo che la cache KV rimanga attiva. Nei benchmark su Llama 3.1 70B, riduce...
NVIDIA ha dettagliato BioNeMo Inference Runtime (BioIR), una libreria Python che accelera i modelli di previsione della struttura biomolecolare sulle GPU NVIDIA rimanendo nel semplice PyTorch. In un benchmark abbinato su 1.000 centesimi umani...
Amazon SageMaker HyperPod ora supporta la memorizzazione nella cache dei modelli per l'inferenza, che precarica i pesi dei modelli e le immagini dei contenitori sui nodi del cluster in modo che i pod leggano dallo storage NVMe locale invece di scaricarsi sulla rete. Lea…
OpenAI ha rilasciato l'API Agents in versione beta pubblica. Fornisce agli sviluppatori la stessa infrastruttura e la stessa infrastruttura che esegue Codex. OpenAI ospita e mantiene il cablaggio. Gli sviluppatori eseguono il calcolo dell'agente in un sistema gestito da OpenAI...
URL dell'articolo: https://www.theverge.com/ai-artificial-intelligence/993263/where-does-openai-get-mathematics-training-data URL dei commenti: https://news.ycombinator.com/item?id=49641792 Punti: 55 # Commenti: 67
Il 22 luglio 2026, un guasto alla linea di trasmissione ad Ashburn, in Virginia, il cuore del più grande cluster di data center del mondo, ha eliminato dalla rete più di 3 gigawatt di carico in pochi secondi. E non era la prima volta. Due anni…
Gli agenti con orizzonte lungo hanno trasformato il servizio LLM in un carico di lavoro ad alto carico di input. Precompilazioni ripetute e contesti da milioni di token lasciano cache KV che mettono a dura prova HBM, capacità SSD e larghezza di banda. DeepSeek AI ha creato la sua versione più recente a...
Il Massachusetts è diventato il terzo stato in altrettanti mesi a imporre nuove restrizioni allo sviluppo dei data center.
TorchServe non viene più mantenuto, lasciando ai team la proprietà dell'intero stack di inferenza della GPU. Il contenitore di deep learning AWS Ray Serve è un contenitore supportato e pre-testato con framework, driver GPU e livello di servizio...
Kepler Computing sostiene che un nuovo approccio alla progettazione dei chip e un materiale proprietario possono aiutare a porre fine ai colli di bottiglia nell'offerta che hanno fatto lievitare i prezzi delle memorie.
La Patagonia argentina sta attirando l'attenzione come possibile sito per grandi data center AI. L'articolo Patagonia ha ciò che vogliono i data center AI, inclusa nessuna resistenza finora è apparso per la prima volta su The Decoder.
ASML ha convinto Samsung, TSMC e Intel a passare a fotomaschere più grandi, che dovrebbero aumentare la produttività delle sue più recenti macchine EUV del 40%. Nel frattempo, Huawei sta orchestrando la controstrategia cinese, mirando...
Il più recente modello di previsione meteorologica basato sull’intelligenza artificiale di Google prevede la velocità del vento a 100 metri dal suolo, all’incirca l’altezza di una moderna turbina eolica. Prevede anche la copertura nuvolosa e la quantità di luce solare che raggiunge la superficie e...
URL dell'articolo: https://newsroom.arm.com/blog/arm-mali-g2-ultra-nx-ai-native-mobile-graphics URL dei commenti: https://news.ycombinator.com/item?id=49605511 Punti: 43 # Commenti: 26
URL dell'articolo: https://www.bbc.com/news/articles/c0m39g7xzevo URL dei commenti: https://news.ycombinator.com/item?id=49604956 Punti: 15 # Commenti: 14
URL dell'articolo: https://www.ft.com/content/ea9a9dcc-b1df-49b0-b80c-f320161b9efa URL dei commenti: https://news.ycombinator.com/item?id=49593778 Punti: 18 # Commenti: 9
URL dell'articolo: https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html URL dei commenti: https://news.ycombinator.com/item?id=49592508 Punti: 15 # Commenti: 0
Gli agenti di ricerca sull’intelligenza artificiale possono proporre molti più esperimenti di quelli che possono permettersi di eseguire. Meta FAIR, Oxford e UCL introducono modelli di preferenza di ricerca sull'intelligenza artificiale: giudici LLM congelati che classificano 15 candidati non eseguiti ed eseguono solo...
I sondaggi mostrano che la stragrande maggioranza degli americani odia i data center. La Cina rappresenta un perfetto capro espiatorio per i leader tecnologici e i loro alleati: l’unico problema è la mancanza di prove.
La qualità del recupero in un prodotto di ricerca AI è limitata da due cose: quanto è buono il modello di incorporamento e quanto economicamente puoi eseguirlo su un indice. Questa settimana, il team di Perplexity Engineering ha pubblicato Fast Embeddings su GP...
Nous Research ha ridotto la configurazione del modello locale in un solo clic in Hermes Desktop. L'app legge il tuo hardware, confronta il catalogo con la tua GPU, sceglie la build di massima qualità adatta, la scarica e con...
Deepseek vuole mettere 160.000 chip Huawei Ascend-950DT in un data center della Mongolia Interna solo per inferenza, non per formazione. Sarebbe il più grande cluster di chip Huawei conosciuto. Ma i colli di bottiglia nella produzione significano che Huawei probabilmente...
Meno di 24 ore rimaste per candidarti a ospitare un evento collaterale durante TechCrunch Disrupt 2026 e lasciare il segno nella scena della Silicon Valley. Fai domanda prima che le domande chiudano stasera a mezzanotte PT.
L'hub HomeAgent H100 Pro di Ugreen combina archiviazione locale, intelligenza artificiale sul dispositivo e un nuovo assistente vocale, Uliya, per gestire la tua casa intelligente. | Foto di Jennifer Pattison Tuohy / The Verge Ugreen, noto per i suoi power bank telefonici, cha...
Il PAIR (Personal AI Router) di Nvidia diffonde automaticamente le richieste AI locali su tutti i dispositivi disponibili su una rete domestica, riducendo i tempi di attesa per le attività dell'agente parallelo. L'articolo Nvidia vuole che la tua rete domestica funzioni...
Perplexity ha fornito il calcolo ibrido per la sua app Mac, suddividendo una singola attività del computer Perplexity tra modelli di frontiera nel cloud e un modello compatto in esecuzione sul computer dell'utente. Le attività iniziano nel cloud per il mare...
Nvidia annuncia il suo nuovo Personal AI Router (PAIR), uno strumento gratuito che sincronizza i computer di casa per affrontare attività di inferenza AI locale con strumenti come Ollama e LM Studio. Togliamo di mezzo la cosa ovvia...
Sam Altman mette in guardia contro la “sciocchezza insostenibile” nella costruzione dei data center globali di intelligenza artificiale. Troppi fornitori di Neocloud annunciano capacità enormi senza che i clienti lo sostengano. Ammette anche che il calo dei computer...
Il presidente Trump ha reagito duramente alla crescente opposizione ai data center di intelligenza artificiale negli Stati Uniti. L'articolo Le proteste contro i data center dell'intelligenza artificiale giocano a favore della Cina, afferma Trump, è apparso per la prima volta su The Decoder.
Poco più di dieci anni fa, ho guidato la progettazione dei controlli per un sistema di controllo completamente digitale, primo nel suo genere, per una centrale nucleare statunitense. Sulla carta era una bellissima macchina, progettata per funzionare da sola come una moderna compagnia aerea...
La maggior parte degli stack vocali di produzione sono costituiti da tre sistemi uniti insieme. Un modello trascrive, un secondo separa gli interlocutori e un rilevatore decide quando l'utente ha smesso di parlare. Ogni trasferimento aggiunge latenza e un nuovo momento di errore...
Gli assistenti agenti hanno un problema strutturale: il contesto che li rende utili (trattare documenti, file privilegiati, record dei clienti) è esattamente il contesto che gli utenti non possono inviare a un endpoint cloud. Questa settimana, Perplexity s...
Se possiedi un server domestico, un computer da gioco o semplicemente un laptop che non riceve molto amore, ascolta. Ora puoi utilizzare quella potenza di calcolo di riserva e guadagnare un reddito passivo nel processo. Le aziende di intelligenza artificiale sono hu...
Nvidia lancerà ufficialmente DLSS 5 questa settimana, a seguito di un annuncio controverso di marzo in cui abbiamo paragonato la tecnologia di upscaling dell'intelligenza artificiale a un "filtro AI generativo in tempo reale per videogiochi" e "motion smoothing per videogiochi...
Gli agenti vocali falliscono in termini di latenza molto prima di fallire in termini di intelligenza. Il tempo necessario al primo token è la metrica utilizzata dalla maggior parte dei team per scegliere un'API di inferenza ed è il punto di partenza giusto e il punto di arresto sbagliato. Questa panca...
L'azienda sta testando i robot su attività che possono essere eseguite dai tecnici.
La nuova generazione di sistemi per data center sta aumentando l'efficienza con un controllo del traffico più intelligente invece che semplicemente con più cicli del processore.
Il registratore vocale Comulytic Note Pro AI racchiude molta potenza in un dispositivo delle dimensioni di una carta di credito. Ma la sua utilità dipende da te.
Proprio mentre i nuovi data center devono affrontare una crescente reazione da parte delle comunità vicine, l’Environmental Protection Agency (EPA) degli Stati Uniti sta per rendere più difficile per le persone valutare l’eventuale inquinamento creato da tali centri. L’EPA…
L’azienda sta testando robot in grado di scambiare cavi, ripristinare server e svolgere altre attività eseguite dai tecnici, alimentando la preoccupazione di alcuni lavoratori che il loro lavoro potrebbe essere a rischio.
L’industria tecnologica è perplessa di fronte al piano di Trump di vincere la corsa all’intelligenza artificiale tassando i data center.
L’intelligenza artificiale vocale self-hosted comporta un compromesso in termini di osservabilità: i numeri che guidano la pianificazione della capacità e la gestione dei costi rimangono bloccati all’interno del contenitore del fornitore. Deepgram colma questa lacuna sull'intelligenza artificiale di Amazon SageMaker con due ca...
Servire modelli di riconoscimento vocale automatico (ASR) su larga scala è costoso quando ogni richiesta utilizza solo una frazione di una GPU. Scopri come NVIDIA CUDA Multi-Process Service (MPS) con NVIDIA Triton Inference Server su Amazon EC2 G...
I riepiloghi sono aggregati solo a scopo informativo: segui il collegamento alla fonte per la storia completa. Le voci demo sono illustrative.