Rechenleistung, GPUs, Rechenzentren und Energie – die physische Schicht, die darüber entscheidet, wie kostengünstig KI läuft.
50-Geschichten
Rechenleistung, Energie und Rechenzentrumskapazität entscheiden darüber, wie kostengünstig KI betrieben werden kann. Infrastrukturverschiebungen zeigen sich Wochen später in den Inferenzkosten.
Artikel-URL: https://system76.com/workstations/thelio-mira-ai Kommentar-URL: https://news.ycombinator.com/item?id=49651372 Punkte: 18 # Kommentare: 9
Amazon SageMaker Inference bietet jetzt präfixbewusstes Routing, eine Routing-Strategie, die Anfragen mit demselben Eingabeaufforderungspräfix an dieselbe Instanz sendet, damit der KV-Cache warm bleibt. In Benchmarks auf Llama 3.1 70B reduzierte es…
NVIDIA verfügt über BioNeMo Inference Runtime (BioIR), eine Python-Bibliothek, die Modelle zur Vorhersage biomolekularer Strukturen auf NVIDIA-GPUs beschleunigt und gleichzeitig im einfachen PyTorch bleibt. In einem abgestimmten Benchmark für 1.000 menschliche Cent…
Amazon SageMaker HyperPod unterstützt jetzt Modell-Caching für Inferenz, wodurch Modellgewichtungen und Container-Images vorab auf Cluster-Knoten geladen werden, sodass Pods aus dem lokalen NVMe-Speicher lesen, anstatt sie über das Netzwerk herunterzuladen. Lea…
OpenAI hat die Agents API in der öffentlichen Betaversion veröffentlicht. Es bietet Entwicklern die gleiche Nutzung und Infrastruktur, die Codex ausführen. OpenAI hostet und pflegt den Kabelbaum. Entwickler führen die Rechenleistung des Agenten in einem von OpenAI verwalteten… aus.
Artikel-URL: https://www.theverge.com/ai-artificial-intelligence/993263/where-does-openai-get-mathematics-training-data Kommentar-URL: https://news.ycombinator.com/item?id=49641792 Punkte: 55 # Kommentare: 67
Am 22. Juli 2026 hat ein Übertragungsleitungsfehler in Ashburn, Virginia – dem Herzen des weltweit größten Rechenzentrumsclusters – innerhalb von Sekunden mehr als 3 Gigawatt Last vom Netz genommen. Und es war nicht das erste Mal. Zwei Jahre…
Langfristige Agenten haben die LLM-Betreuung zu einer eingabeintensiven Arbeitsbelastung gemacht. Wiederholte Vorabfüllungen und Millionen-Token-Kontexte hinterlassen KV-Caches, die HBM, SSD-Kapazität und Bandbreite belasten. DeepSeek AI hat seine neueste Version erstellt…
Massachusetts ist innerhalb weniger Monate der dritte Bundesstaat, der neue Beschränkungen für die Entwicklung von Rechenzentren einführt.
TorchServe wird nicht mehr gepflegt, so dass die Teams Eigentümer des gesamten GPU-Inferenzstapels bleiben. Der AWS Ray Serve Deep Learning Container ist ein unterstützter, vorab getesteter Container mit dem Framework, GPU-Treibern und der Bereitstellungsschicht …
Kepler Computing behauptet, dass ein neuer Ansatz für das Chip-Design – und ein proprietäres Material – dazu beitragen können, die Lieferengpässe zu beseitigen, die zu einem Anstieg der Speicherpreise geführt haben.
Das argentinische Patagonien macht als möglicher Standort für große KI-Rechenzentren auf sich aufmerksam. Der Artikel Patagonia hat, was KI-Rechenzentren wollen, einschließlich bisher keinem Widerstand, erschien zuerst auf The Decoder.
ASML hat Samsung, TSMC und Intel davon überzeugt, auf größere Fotomasken umzusteigen, was den Durchsatz seiner neuesten EUV-Maschinen um 40 Prozent steigern dürfte. Unterdessen orchestriert Huawei Chinas Gegenstrategie und zielt darauf ab…
Googles neuestes KI-Wettervorhersagemodell sagt die Windgeschwindigkeit in 100 Metern Höhe über dem Boden voraus, was ungefähr der Höhe einer modernen Windkraftanlage entspricht. Es prognostiziert auch die Wolkendecke und wie viel Sonnenlicht die Oberfläche erreicht, und…
Artikel-URL: https://newsroom.arm.com/blog/arm-mali-g2-ultra-nx-ai-native-mobile-graphics Kommentar-URL: https://news.ycombinator.com/item?id=49605511 Punkte: 43 # Kommentare: 26
Artikel-URL: https://www.bbc.com/news/articles/c0m39g7xzevo Kommentar-URL: https://news.ycombinator.com/item?id=49604956 Punkte: 15 # Kommentare: 14
Artikel-URL: https://www.ft.com/content/ea9a9dcc-b1df-49b0-b80c-f320161b9efa Kommentar-URL: https://news.ycombinator.com/item?id=49593778 Punkte: 18 # Kommentare: 9
Artikel-URL: https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html Kommentar-URL: https://news.ycombinator.com/item?id=49592508 Punkte: 15 # Kommentare: 0
KI-Forscher können weit mehr Experimente vorschlagen, als sie sich leisten können. Meta FAIR, Oxford und UCL führen Präferenzmodelle für die KI-Forschung ein – eingefrorene LLM-Richter, die 15 nicht gewählte Kandidaten bewerten und nur ausführen …
Umfragen zeigen, dass eine überwältigende Mehrheit der Amerikaner Rechenzentren hasst. China ist ein perfekter Sündenbock für Technologieführer und ihre Verbündeten – das einzige Problem ist der Mangel an Beweisen.
Die Abrufqualität in einem KI-Suchprodukt hängt von zwei Dingen ab: Wie gut das Einbettungsmodell ist und wie kostengünstig Sie es über einen Index hinweg ausführen können. Diese Woche veröffentlichte das Perplexity Engineering-Team Fast Embeddings auf GP…
Nous Research hat die Einrichtung lokaler Modelle in Hermes Desktop mit einem einzigen Klick zusammengefasst. Die App liest Ihre Hardware, vergleicht den Katalog mit Ihrer GPU, wählt den hochwertigsten Build aus, der passt, lädt ihn herunter und fährt fort.
Deepseek möchte 160.000 Huawei Ascend-950DT-Chips nur zu Rückschlusszwecken und nicht zum Training in ein Rechenzentrum in der Inneren Mongolei einbauen. Es wäre der größte bekannte Huawei-Chip-Cluster. Doch Produktionsengpässe bedeuten für Huawei ein Problem…
Es bleiben weniger als 24 Stunden, um sich für die Ausrichtung eines Side Events während TechCrunch Disrupt 2026 zu bewerben und sich in der Silicon Valley-Szene einen Namen zu machen. Bewerben Sie sich, bevor die Bewerbung heute Abend um Mitternacht PT endet.
Der HomeAgent H100 Pro-Hub von Ugreen kombiniert lokalen Speicher, On-Device-KI und einen neuen Sprachassistenten, Uliya, um Ihr Smart Home zu betreiben. | Foto von Jennifer Pattison Tuohy / The Verge Ugreen, bekannt für seine Handy-Powerbanks, cha…
Nvidias PAIR (Personal AI Router) verteilt lokale KI-Anfragen automatisch auf alle verfügbaren Geräte in einem Heimnetzwerk und verkürzt so die Wartezeiten für parallele Agentenaufgaben. Der Artikel Nvidia möchte, dass Ihr Heimnetzwerk funktioniert…
Perplexity hat Hybrid Computing für seine Mac-App bereitgestellt und eine einzelne Perplexity Computer-Aufgabe zwischen Frontier-Modellen in der Cloud und einem kompakten Modell aufgeteilt, das auf dem Computer des Benutzers ausgeführt wird. Aufgaben beginnen in der Cloud für Meer…
Nvidia kündigt seinen neuen Personal AI Router (PAIR) an, ein kostenloses Tool, das Ihre Heimcomputer synchronisiert, um lokale KI-Inferenzaufgaben mit Tools wie Ollama und LM Studio zu bewältigen. Lassen Sie uns das Offensichtliche aus dem Weg räumen …
Sam Altman warnt vor „unhaltbarer Albernheit“ beim Ausbau des globalen KI-Rechenzentrums. Zu viele Neocloud-Anbieter kündigen enorme Kapazitäten an, ohne dass die Kunden dies unterstützen. Er gibt auch zu, dass die Computertechnologie sinkt …
Präsident Trump hat sich energisch gegen den wachsenden Widerstand gegen KI-Rechenzentren in den USA gewehrt. Der Artikel „Proteste gegen KI-Rechenzentren spielen China in die Hände“, sagt Trump, erschien zuerst auf The Decoder.
Vor etwas mehr als einem Jahrzehnt leitete ich den Steuerungsentwurf für das erste vollständig digitale Steuerungssystem seiner Art für ein US-Atomkraftwerk. Auf dem Papier war es eine wunderschöne Maschine – konstruiert, um sich wie eine moderne Fluggesellschaft zu bewegen …
Die meisten Produktions-Voice-Stacks bestehen aus drei zusammengefügten Systemen. Ein Modell transkribiert, ein zweites trennt die Sprecher und ein Detektor entscheidet, wann der Benutzer aufgehört hat zu sprechen. Jede Übergabe erhöht die Latenz und ein neues Fehlermo…
Agentenassistenten haben ein strukturelles Problem: Der Kontext, der sie nützlich macht – Geschäftsdokumente, privilegierte Dateien, Kundendatensätze – ist genau der Kontext, den Benutzer nicht an einen Cloud-Endpunkt senden können. Diese Woche, Perplexity s…
Wenn Sie einen Server zu Hause, einen Gaming-Computer oder einfach nur einen Laptop besitzen, der nicht besonders beliebt ist, sollten Sie aufmerksam sein. Jetzt können Sie die freie Rechenleistung nutzen und dabei ein passives Einkommen erzielen. KI-Unternehmen sind hu…
Nvidia bringt DLSS 5 diese Woche offiziell auf den Markt, nachdem es im März eine umstrittene Ankündigung gab, in der wir die KI-Upscaling-Technologie mit einem „generativen Echtzeit-KI-Filter für Videospiele“ und „Bewegungsglättung für Videospiele“ verglichen haben.
Sprachagenten scheitern an der Latenz, lange bevor sie an der Intelligenz scheitern. Die Zeit bis zum ersten Token ist die Metrik, die die meisten Teams zur Auswahl einer Inferenz-API verwenden, und sie ist der richtige Ausgangspunkt und der falsche Endpunkt. Diese Bank…
Das Unternehmen testet Roboter auf Aufgaben, die von Technikern ausgeführt werden können.
Die neue Generation von Rechenzentrumssystemen steigert die Effizienz durch intelligentere Verkehrssteuerung statt nur durch mehr Prozessorzyklen.
Der Comulytic Note Pro AI Diktiergerät bietet viel Leistung in einem Gerät im Kreditkartenformat. Aber der Nutzen liegt bei Ihnen.
Gerade als neue Rechenzentren mit zunehmendem Widerstand von Nachbargemeinden konfrontiert werden, ist die US-Umweltschutzbehörde (EPA) dabei, es den Menschen schwerer zu machen, sich zu der durch diese Zentren verursachten Umweltverschmutzung zu beschweren. Die EPA…
Das Unternehmen testet Roboter, die Kabel austauschen, Server zurücksetzen und andere Aufgaben von Technikern übernehmen können, was bei einigen Arbeitnehmern die Sorge schürt, dass ihr Arbeitsplatz gefährdet sein könnte.
Die Technologiebranche ist verwirrt über Trumps Plan, den KI-Wettbewerb durch die Besteuerung von Rechenzentren zu gewinnen.
Selbstgehostete Sprach-KI bringt einen Kompromiss hinsichtlich der Beobachtbarkeit mit sich: Die Zahlen, die die Kapazitätsplanung und das Kostenmanagement steuern, bleiben im Container des Anbieters verborgen. Deepgram schließt diese Lücke bei Amazon SageMaker AI mit zwei Ca…
Die Bereitstellung von ASR-Modellen (Automatic Speech Recognition) im großen Maßstab ist kostspielig, wenn jede Anfrage nur einen Bruchteil einer GPU beansprucht. Erfahren Sie, wie NVIDIA CUDA Multi-Process Service (MPS) mit NVIDIA Triton Inference Server auf Amazon EC2 G…
Google legt neue Speichernutzungsgrenzen für Android-Apps fest, da KI-Rechenzentren zu Hardware-Engpässen beitragen, die dazu führen könnten, dass kostengünstigere Telefone über weniger Speicher verfügen.
Heute spreche ich bei Decoder mit dem leitenden AI-Reporter von Verge, Hayden Field, über einen reinen Decoder-Köder: die scheinbar endlosen Organigrammänderungen bei OpenAI und wie sie alle unter Mitbegründer Greg ihre Macht zu festigen scheinen …
Sie haben Fragen zu Rechenzentren und WIRED hat Antworten. Nehmen Sie am 10. September an unserem Livestream teil und unser Expertengremium verrät Ihnen alles, was Sie wissen müssen.
Googles neues Gemini 3.5 Transcribe erkennt über 85 Sprachen, entfernt Füllwörter und korrigiert Versprecher in Echtzeit. Im Streaming-Modus wird eine Wortfehlerrate von 4,0 Prozent erreicht, bei einer um 70 Prozent geringeren Latenz …
Amazon erweitert seine Rechenzentren in den nächsten zwei Jahren um weitere 2 Millionen Nvidia-GPU-Chips. Diese erweiterten Partnerschaften gehen jedoch über den Kauf weiterer Chips hinaus.
Die nächste KI-Welle stellt neue Anforderungen an die Infrastruktur. Da KI-Agenten und Billionen-Parameter-Workloads zum Mainstream werden, hängt die Leistung der KI-Infrastruktur nicht nur von der Rechenleistung ab, sondern auch davon, wie Rechenleistung, Arbeitsspeicher usw. sind.
Zusammenfassungen werden nur zu Informationszwecken aggregiert – folgen Sie dem Quelllink für die vollständige Geschichte. Demo-Einträge dienen der Veranschaulichung.