Fourniture de calcul, GPU, centres de données et énergie : la couche physique qui décide du fonctionnement à moindre coût de l'IA.
Histoires 43
L’approvisionnement informatique, l’énergie et la capacité du centre de données déterminent le coût de fonctionnement de l’IA. Les changements d’infrastructure apparaissent dans les coûts d’inférence des semaines plus tard.
NVIDIA utilise Palantir Foundry et cuOpt pour automatiser ses décisions d'allocation de la chaîne d'approvisionnement matérielle sur les sites de fabrication mondiaux. La société mesure la livraison opérationnelle depuis la sortie de la tranche jusqu'au premier jeton. Ce vent…
URL de l'article : https://system76.com/workstations/thelio-mira-ai URL des commentaires : https://news.ycombinator.com/item?id=49651372 Points : 18 # Commentaires : 9
Amazon SageMaker Inference propose désormais un routage prenant en compte le préfixe, une stratégie de routage qui envoie des requêtes partageant le même préfixe d'invite à la même instance afin que le cache KV reste chaud. Dans les benchmarks sur Llama 3.1 70B, cela réduit…
NVIDIA a détaillé BioNeMo Inference Runtime (BioIR), une bibliothèque Python qui accélère les modèles de prédiction de structure biomoléculaire sur les GPU NVIDIA tout en restant dans PyTorch simple. Dans une référence équivalente sur 1 000 centimes humains…
Amazon SageMaker HyperPod prend désormais en charge la mise en cache des modèles pour l'inférence, qui précharge les poids des modèles et les images de conteneurs sur les nœuds du cluster afin que les pods lisent à partir du stockage NVMe local au lieu de les télécharger sur le réseau. Léa…
OpenAI a publié l'API Agents en version bêta publique. Il offre aux développeurs le même harnais et la même infrastructure que ceux qui exécutent le Codex. OpenAI héberge et maintient le harnais. Les développeurs exécutent le calcul de l'agent dans un environnement géré par OpenAI…
URL de l'article : https://www.theverge.com/ai-artificial-intelligence/993263/where-does-openai-get-mathematics-training-data URL des commentaires : https://news.ycombinator.com/item?id=49641792 Points : 55 # Commentaires : 67
Le 22 juillet 2026, une panne de ligne de transmission à Ashburn, en Virginie, au cœur du plus grand cluster de centres de données au monde, a fait chuter plus de 3 gigawatts de charge du réseau en quelques secondes. Et ce n’était pas la première fois. Deux ans…
Les agents à long horizon ont transformé le service LLM en une charge de travail lourde en intrants. Les préremplissages répétés et les contextes comportant des millions de jetons laissent des caches KV qui mettent à rude épreuve la capacité du HBM, du SSD et de la bande passante. DeepSeek AI a construit sa dernière version un…
Le Massachusetts est devenu le troisième État en autant de mois à imposer de nouvelles restrictions au développement des centres de données.
TorchServe n'est plus maintenu, laissant les équipes propriétaires de l'intégralité de la pile d'inférence GPU. Le conteneur AWS Ray Serve Deep Learning est un conteneur pris en charge et pré-testé avec le framework, les pilotes GPU et la couche de service…
Kepler Computing affirme qu'une nouvelle approche de la conception des puces – et un matériau exclusif – peuvent aider à mettre fin aux goulots d'étranglement d'approvisionnement qui ont fait grimper les prix des mémoires.
La Patagonie argentine attire l'attention en tant que site possible pour de grands centres de données d'IA. L'article Patagonia a ce que veulent les centres de données IA, y compris aucune résistance jusqu'à présent, est apparu en premier sur The Decoder.
ASML a convaincu Samsung, TSMC et Intel de passer à des photomasques plus grands, ce qui devrait augmenter de 40 % le débit de ses dernières machines EUV. Pendant ce temps, Huawei orchestre la contre-stratégie chinoise, visant…
Le dernier modèle de prévision météorologique IA de Google prédit la vitesse du vent à 100 mètres au-dessus du sol, soit à peu près la hauteur d’une éolienne moderne. Il prévoit également la couverture nuageuse et la quantité de lumière solaire atteignant la surface, et…
URL de l'article : https://newsroom.arm.com/blog/arm-mali-g2-ultra-nx-ai-native-mobile-graphics URL des commentaires : https://news.ycombinator.com/item?id=49605511 Points : 43 # Commentaires : 26
URL de l'article : https://www.bbc.com/news/articles/c0m39g7xzevo URL des commentaires : https://news.ycombinator.com/item?id=49604956 Points : 15 # Commentaires : 14
URL de l'article : https://www.ft.com/content/ea9a9dcc-b1df-49b0-b80c-f320161b9efa URL des commentaires : https://news.ycombinator.com/item?id=49593778 Points : 18 # Commentaires : 9
URL de l'article : https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html URL des commentaires : https://news.ycombinator.com/item?id=49592508 Points : 15 # Commentaires : 0
Les agents de recherche en IA peuvent proposer bien plus d’expériences qu’ils ne peuvent se permettre d’en réaliser. Meta FAIR, Oxford et UCL introduisent des modèles de préférences de recherche en IA – des juges LLM gelés qui classent 15 candidats non exécutés et n'exécutent que…
Les sondages montrent qu’une écrasante majorité d’Américains détestent les centres de données. La Chine constitue un parfait bouc émissaire pour les leaders technologiques et leurs alliés – le seul problème est le manque de preuves.
La qualité de la récupération dans un produit de recherche IA est limitée par deux choses : la qualité du modèle d'intégration et le coût réduit de son exécution sur un index. Cette semaine, l'équipe Perplexity Engineering a publié Fast Embeddings sur GP…
Nous Research a réduit la configuration du modèle local en un seul clic dans Hermes Desktop. L'application lit votre matériel, vérifie l'ajustement du catalogue par rapport à votre GPU, sélectionne la version de la plus haute qualité qui convient, la télécharge et con…
Deepseek souhaite installer 160 000 puces Huawei Ascend-950DT dans un centre de données de Mongolie intérieure à des fins d'inférence uniquement, et non de formation. Il s'agirait du plus grand cluster de puces Huawei connu. Mais les goulots d’étranglement de la production signifient que Huawei a des problèmes…
Il reste moins de 24 heures pour postuler pour organiser un événement parallèle lors de TechCrunch Disrupt 2026 et faire votre marque sur la scène de la Silicon Valley. Postulez avant la clôture des candidatures ce soir à minuit (heure du Pacifique).
Le hub HomeAgent H100 Pro d'Ugreen combine le stockage local, l'IA sur l'appareil et un nouvel assistant vocal, Uliya, pour gérer votre maison intelligente. | Photo de Jennifer Pattison Tuohy / The Verge Ugreen, connu pour ses banques d'alimentation pour téléphone, cha…
Le PAIR (Personal AI Router) de Nvidia répartit automatiquement les requêtes IA locales sur tous les appareils disponibles sur un réseau domestique, réduisant ainsi les temps d'attente pour les tâches d'agent parallèles. L'article Nvidia veut que votre réseau domestique fonctionne…
Perplexity a livré un calcul hybride pour son application Mac, divisant une seule tâche Perplexity Computer entre des modèles frontières dans le cloud et un modèle compact exécuté sur la machine de l'utilisateur. Les tâches démarrent dans le cloud pour la mer…
Nvidia annonce son nouveau Personal AI Router (PAIR), un outil gratuit qui synchronise vos ordinateurs personnels pour effectuer des tâches d'inférence d'IA locales avec des outils comme Ollama et LM Studio. Éliminons l'évidence du problème…
Sam Altman met en garde contre une « bêtise insoutenable » dans la construction d’un centre de données mondial sur l’IA. Trop de fournisseurs Neocloud annoncent des capacités massives sans que les clients ne puissent les sauvegarder. Il admet également que la chute de l'informatique…
Le président Trump s’est vigoureusement opposé à l’opposition croissante aux centres de données d’IA aux États-Unis. L'article Les protestations contre les centres de données IA font le jeu de la Chine, selon Trump, apparu en premier sur The Decoder.
Il y a un peu plus de dix ans, j'ai dirigé la conception des commandes d'un système de commande entièrement numérique, le premier du genre, pour une centrale nucléaire américaine. C’était, sur le papier, une belle machine, conçue pour fonctionner comme une compagnie aérienne moderne…
La plupart des piles vocales de production sont constituées de trois systèmes assemblés. Un modèle retranscrit, un second sépare les haut-parleurs et un détecteur décide quand l'utilisateur a arrêté de parler. Chaque transfert ajoute de la latence et un nouveau moment d'échec…
Les assistants agents ont un problème structurel : le contexte qui les rend utiles (documents de transaction, fichiers privilégiés, enregistrements clients) est exactement le contexte que les utilisateurs ne peuvent pas envoyer à un point de terminaison cloud. Cette semaine, Perplexité s…
Si vous possédez un serveur domestique, un ordinateur de jeu ou simplement un ordinateur portable qui ne suscite pas beaucoup d’amour, écoutez. Vous pouvez désormais utiliser cette puissance de calcul disponible et gagner ainsi un revenu passif. Les entreprises d’IA sont énormes…
Nvidia lance officiellement DLSS 5 cette semaine, suite à une annonce controversée en mars où nous comparions la technologie de mise à l'échelle de l'IA à un « filtre d'IA génératif en temps réel pour les jeux vidéo » et à un « lissage de mouvement pour les jeux vidéo »
Les agents vocaux échouent en termes de latence bien avant d’échouer en termes d’intelligence. Le temps jusqu'au premier jeton est la métrique que la plupart des équipes utilisent pour choisir une API d'inférence, et c'est le bon point de départ et le mauvais point d'arrêt. Ce banc…
L'entreprise teste des robots sur des tâches pouvant être effectuées par des techniciens.
La nouvelle génération de systèmes de centres de données augmente l'efficacité grâce à un contrôle du trafic plus intelligent au lieu de simplement davantage de cycles de processeur.
L'enregistreur vocal Comulytic Note Pro AI offre beaucoup de puissance dans un appareil de la taille d'une carte de crédit. Mais son utilité dépend de vous.
Alors que les nouveaux centres de données font face à des réactions croissantes de la part des communautés voisines, l'Agence américaine de protection de l'environnement (EPA) est sur le point de rendre plus difficile pour les gens de peser sur la pollution créée par ces centres. L’EPA…
L'entreprise teste des robots capables d'échanger des câbles, de réinitialiser des serveurs et d'effectuer d'autres tâches effectuées par des techniciens, alimentant les inquiétudes de certains travailleurs quant à la menace pour leur emploi.
L’industrie technologique est perplexe face au projet de Trump de remporter la course à l’IA en taxant les centres de données.
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.