{"id":32065,"date":"2026-08-16T22:49:52","date_gmt":"2026-08-16T20:49:52","guid":{"rendered":"https:\/\/pi3g.com\/?p=32065"},"modified":"2026-08-16T22:49:55","modified_gmt":"2026-08-16T20:49:55","slug":"nvidia-dgx-station-gb300-compared-with-4x-8x-rtx-pro-6000-server-edition-gpu-server","status":"publish","type":"post","link":"https:\/\/pi3g.com\/de\/nvidia-dgx-station-gb300-compared-with-4x-8x-rtx-pro-6000-server-edition-gpu-server\/","title":{"rendered":"NVIDIA DGX Station GB300 im Vergleich zu einem Server mit 4 bzw. 8 RTX PRO 6000 Server Edition-Grafikprozessoren"},"content":{"rendered":"<p class=\"wp-block-paragraph\">Die <a href=\"https:\/\/pi3g.com\/de\/nvidia-dgx-station-available-now-for-purchase-from-us\/\">NVIDIA DGX Station GB300<\/a> ist ein interessantes Angebot f\u00fcr Teams, die auf Cloud-Unabh\u00e4ngigkeit angewiesen sind. Es ist in erster Linie f\u00fcr den Einsatz im B\u00fcro gedacht und zeichnet sich als relativ leises Ger\u00e4t mit einem 1600-W-Netzteil aus. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Einige Teams sind jedoch auch in der Lage, ihre eigenen Server in einem Rechenzentrum zu betreiben. Daher ist es sinnvoll, die NVIDIA DGX Station GB300 mit einem leistungsstarken Server zu vergleichen, der mit mehreren NVIDIA RTX PRO 6000 Blackwell Server Edition-Grafikprozessoren ausgestattet ist. <\/p>\n\n\n\n<h1 class=\"wp-block-heading\">Zusammenfassung: DGX Station GB300 im Vergleich zu RTX Pro 6000 Server Edition-GPUs<\/h1>\n\n\n\n<p class=\"wp-block-paragraph\">Um Frontier-Modelle einer Arbeitsgruppe zur Verf\u00fcgung zu stellen, muss die <a href=\"https:\/\/pi3g.com\/de\/nvidia-dgx-station-available-now-for-purchase-from-us\/\">DGX Station GB300<\/a> ist die richtige Wahl. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Die DGX Station GB300 \u00fcbertrifft vier RTX PRO 6000 Blackwell Server Edition in den relevanten Leistungskennzahlen (FP4, FP8, FP16\/BF16) und bietet eine h\u00f6here Speicherbandbreite zu einem geringf\u00fcgig h\u00f6heren Preis. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ein wesentlicher Vorteil ist der gr\u00f6\u00dfere Speicherblock einer einzelnen GPU, wodurch der Konfigurationsaufwand und die Kommunikationslatenzen beim Sharding von Modellen reduziert werden. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Zudem weist die DGX Station im Vergleich zu Servern mit 4x und 8x RTX Pro eine deutlich geringere Leistungsaufnahme auf, wodurch sie mit herk\u00f6mmlichen B\u00fcro-Steckdosen kompatibel ist. Die geringere Leistungsaufnahme bedeutet weniger Ger\u00e4uschentwicklung und niedrigere Stromkosten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ein Server mit 8x RTX PRO 6000 Server Edition ist in der Lage, Modelle mit h\u00f6herer Genauigkeit zu verarbeiten. Dar\u00fcber hinaus verf\u00fcgt er \u00fcber eine x86-Architektur, die mit \u00e4lterer Software kompatibel ist, sowie \u00fcber mehr CPU-Arbeitsspeicher. Bei korrekter Nutzung k\u00f6nnte die h\u00f6here Gesamtbandbreite des GPU-Speichers einen h\u00f6heren Durchsatz an Token pro Sekunde erm\u00f6glichen. Ein Vergleich mit einer Konfiguration aus zwei NVIDIA DGX Station GB300 ist empfehlenswert.  <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Wir k\u00f6nnen Sie dabei unterst\u00fctzen, die richtige L\u00f6sung f\u00fcr Ihre Anwendung zu finden. Nehmen Sie Kontakt mit uns auf:<\/p>\n\n\n\n<div class=\"wp-block-buttons is-content-justification-center is-layout-flex wp-container-core-buttons-is-layout-fe48e5de wp-block-buttons-is-layout-flex\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"\/de\/kontakt\/\">Wenden Sie sich an pi3g, um LLM-Inferenzserver zu erwerben<\/a><\/div>\n<\/div>\n\n\n\n<h1 class=\"wp-block-heading\">Detaillierter Vergleich<\/h1>\n\n\n\n<p class=\"wp-block-paragraph\">Die DGX Station sowie die Multi-GPU-Server sind bei mehreren Anbietern erh\u00e4ltlich. Supermicro ist derzeit mit wettbewerbsf\u00e4higen Preisen f\u00fchrend, daher werden wir ein Beispiel von Supermicro heranziehen. Supermicro bietet neben HP ebenfalls eine optionale Rack-Montagel\u00f6sung f\u00fcr die DGX Station an.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><tbody><tr><td><\/td><td><strong>NVIDIA DGX Station GB300<\/strong><\/td><td><strong>Server mit 4x RTX PRO 6000 Server Edition<\/strong><\/td><td><strong>Server mit 8x RTX PRO 6000 Server Edition<\/strong><\/td><\/tr><tr><td>Basismodell \/ Fahrgestell<\/td><td>Supermicro Super AI Station ARS-511GD-NB-LCC<\/td><td>Supermicro AS-5126GS-TNRT Barebone<\/td><td>Supermicro AS-5126GS-TNRT Barebone<\/td><\/tr><tr><td>Formfaktor<\/td><td>Desktop-Tower<br>Optionaler Rack-Montagesatz (5U)<\/td><td>5U-Server f\u00fcr den Rack-Einbau<\/td><td>5U-Server f\u00fcr den Rack-Einbau<\/td><\/tr><tr><td>CPU<\/td><td>1x NVIDIA Grace Neoverse V2-CPU mit 72 Kernen (ARM-basiert)<\/td><td>2 \u00d7 AMD Turin 9555 DP\/UP 64C\/128T 3,2 GHz 256 MB 360 W SP5 HF<br>(EPYC 9005-Serie, Supermicro-Artikelnummer: PSE-TUR9555-1142)<\/td><td>2 \u00d7 AMD Turin 9555 DP\/UP 64C\/128T 3,2 GHz 256 MB 360 W SP5 HF<br>(EPYC 9005-Serie, Supermicro-Artikelnummer: PSE-TUR9555-1142)<\/td><\/tr><tr><td>CPU, RAM<\/td><td>496 GB ECC LPDDR5X<\/td><td>768 GB <br>= 24 \u00d7 32 GB DDR5-6400 2Rx8 (16 Gb) ECC RDIMM<\/td><td>768 GB <br>= 24 \u00d7 32 GB DDR5-6400 2Rx8 (16 Gb) ECC RDIMM<\/td><\/tr><tr><td>CPU-Speicherbandbreite<\/td><td>396 GB\/s<\/td><td>1,23 TB\/s = 2 \u00d7 614 GB\/s pro CPU<\/td><td>1,23 TB\/s = 2 \u00d7 614 GB\/s pro CPU<\/td><\/tr><tr><td>Gemeinsamer Speicher f\u00fcr CPU und GPU<br>(koh\u00e4renter Speicher)<\/td><td>Ja, \u00fcber NVLink\u00ae-C2C mit einer Verbindungsbandbreite von 900 GB\/s<\/td><td>keine<\/td><td>keine<\/td><\/tr><tr><td>GPU(s)<\/td><td>1x NVIDIA Blackwell Ultra-GPU<\/td><td>4x NVIDIA RTX PRO 6000 Blackwell Server Edition, PCIe 5<\/td><td>8x NVIDIA RTX PRO 6000 Blackwell Server Edition, PCIe 5<\/td><\/tr><tr><td>GPU-Arbeitsspeicher<\/td><td>252 GB ECC HBM3e<\/td><td>pro GPU: 96 GB GDDR7<br>Gesamt: 384 GB GDDR7<\/td><td>pro GPU: 96 GB GDDR7<br>Gesamt: 768 GB GDDR7<\/td><\/tr><tr><td>GPU-Speicherbandbreite<\/td><td>7,1 TB\/s<\/td><td>pro GPU: 1,597 GB\/s<br>Gesamt: 6,4 TB\/s<\/td><td>pro GPU: 1,597 GB\/s<br>Gesamt: 12,8 TB\/s<\/td><\/tr><tr><td>Multi-Instance-GPU (MIG)<\/td><td>Ja, bis zu 7 MIGs<\/td><td>Ja, bis zu 4 MIGs pro GPU<\/td><td>Ja, bis zu 4 MIGs pro GPU<\/td><\/tr><tr><td>High-Speed-Ethernet-Anschluss<\/td><td>NVIDIA ConnectX-8 SuperNIC, Dual-Port-QSFP112<\/td><td>ConnectX-6 Dx 100-GbE-Ethernet-Adapterkarte, zwei QSFP56-Anschl\u00fcsse<\/td><td>ConnectX-6 Dx 100-GbE-Ethernet-Adapterkarte, zwei QSFP56-Anschl\u00fcsse<\/td><\/tr><tr><td>Bandbreite von High-Speed-Ethernet<\/td><td> 800 Gbit\/s<br>= 2 \u00d7 400 Gbit\/s<\/td><td>200 Gbit\/s<br>= 2 \u00d7 100 Gbit\/s<\/td><td>200 Gbit\/s<br>= 2 \u00d7 100 Gbit\/s<\/td><\/tr><tr><td>Lagerung<\/td><td>4 M.2-Steckpl\u00e4tze:<br>2x 2 TB M.2 PCIe 5.0\u00d74 NVMe-Bootlaufwerke<br>1x 2 TB M.2-Datenspeicher<\/td><td>2x SSD 2,5\u2033 SATA 480 GB 1 DWPD TLC E, SED\/TCG 7 mm<\/td><td>2x SSD 2,5\u2033 SATA 480 GB 1 DWPD TLC E, SED\/TCG 7 mm<\/td><\/tr><tr><td>Stromverbrauch<\/td><td>bis zu 1600 W<\/td><td><br>Insgesamt etwa 4000 W<br>Bis zu 360 W pro CPU<br>Bis zu 600 W pro GPU<br><\/td><td>Insgesamt etwa 7.000 W<br>Bis zu 360 W pro CPU<br>Bis zu 600 W pro GPU<\/td><\/tr><tr><td>Eignung f\u00fcr den B\u00fcrobetrieb<\/td><td>gut geeignet:<br>zul\u00e4ssiger Ger\u00e4uschpegel \u2013 Fl\u00fcssigkeitsk\u00fchlsystem<br>kann \u00fcber eine B\u00fcrosteckdose mit Strom versorgt werden <br>Desktop-Tower-Formfaktor<\/td><td>nicht geeignet:<br>laut<br>erfordert Steckdosen in Industrieausf\u00fchrung<br>Rack-Formfaktor, erfordert einen Rack-Einbau<\/td><td>nicht geeignet:<br>laut<br>erfordert Steckdosen in Industrieausf\u00fchrung<br>Rack-Formfaktor, erfordert einen Rack-Einbau<\/td><\/tr><tr><td>Preis (netto, USD)<\/td><td>ca. $105.000<\/td><td>ca. $100.000<\/td><td>ca. $150.000<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<h1 class=\"wp-block-heading\">KI-Leistung: 1x DGX Station GB300 im Vergleich zu 4 bzw. 8x NVIDIA RTX PRO 6000 Blackwell Server Edition<\/h1>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><tbody><tr><td><\/td><td><strong>NVIDIA DGX Station GB300<\/strong><\/td><td><strong>RTX PRO 6000 Server Edition, pro GPU<\/strong><\/td><td><strong>4x RTX PRO 6000 Server Edition<\/strong><\/td><td><strong>8x RTX PRO 6000 Server Edition<\/strong><\/td><\/tr><tr><td>CUDA-Parallelverarbeitungskerne<\/td><td>TBD<\/td><td>24.064<\/td><td>96.256<\/td><td>192.512<\/td><\/tr><tr><td>NVIDIA Tensor-Kerne<\/td><td>TBD<\/td><td>752<br>(f\u00fcnfte Generation)<\/td><td>3.008<\/td><td>6.016<\/td><\/tr><tr><td>NVIDIA-RT-Kerne<\/td><td>K.A.<\/td><td>188<br>(vierte Generation)<\/td><td>752<\/td><td>1.504<\/td><\/tr><tr><td>FP4 PFLOPS<\/td><td>20 PFLOPS<br>15 PFLOPS ohne Sparsity<\/td><td>4 PFLOPS<br>1.871,2 TFLOPS ohne Sparsity<\/td><td>16 PFLOPS<br>7,5 PFLOPS ohne Sparsity<\/td><td>32 PFLOPS<br>15 PFLOPS ohne Sparsity<\/td><\/tr><tr><td>FP8<\/td><td>10 PFLOPS<br>5.000 TFLOPS ohne Sparsity<\/td><td>2 PFLOPS<br>935,6 TFLOPS ohne Sparsity<\/td><td>8 PFLOPS<br>3.742 TFLOPS ohne Sparsity<\/td><td>16 PFLOPS<br>7.485 TFLOPS ohne Sparsity<br><\/td><\/tr><tr><td>FP6-Tensor-Core<\/td><td>10 PFLOPS<\/td><td>K.A.<\/td><td>K.A.<\/td><td>K.A.<\/td><\/tr><tr><td>Int8-Tensor-Core<\/td><td>330 TOPS (? NVIDIA)<br>5.000 TOPS ohne Sparsity (? Google)<\/td><td>935,6 TOPS ohne Sparsity <\/td><td>3.742 TOPS ohne Sparsity<\/td><td>3.742 TOPS ohne Sparsity<\/td><\/tr><tr><td>FP16\/BF16-Tensor-Core<\/td><td>5 PFLOPS<br>2.500 TFLOPS ohne Sparsity<\/td><td>1 PFLOP<br>467,8 TFLOPS ohne Sparsity<\/td><td>4 PFLOPS<br>1.871 TFLOPS ohne Sparsity<\/td><td>8 PFLOPS<br>3.742 TFLOPS ohne Sparsity<\/td><\/tr><tr><td>TF32 Tensor-Core<\/td><td>2,5 PFLOPS<br>1.250 TFLOPS ohne Sparsity<\/td><td>234 TFLOPS ohne Sparsity<\/td><td>936 TFLOPS ohne Sparsity<\/td><td>1.872 TFLOPS ohne Sparsity<\/td><\/tr><tr><td>FP32<\/td><td>80 TFLOPS<\/td><td>120 TFLOPS<\/td><td>480 TFLOPS<\/td><td>960 TFLOPS<\/td><\/tr><tr><td>FP64 \/ FP64-Tensor-Core<\/td><td>1,3 TFLOPS<\/td><td>1,8 TFLOPS<\/td><td>7,2 TFLOPS<\/td><td>14,4 TFLOPS<\/td><\/tr><tr><td>Leistung des RT-Kerns<\/td><td>K.A.<\/td><td>355 TFLOPS<\/td><td>1.420 TFLOPS<\/td><td>2.840 TFLOPS<\/td><\/tr><tr><td>GPU-Speicher<\/td><td>252 GB HBM3e-Speicher<br><br>kann die 496 GB LPPDR5X der CPU \u00fcber NVLink-C2C nutzen<br><br>= insgesamt 748 GB RAM <\/td><td>96 GB GDDR7 mit ECC<\/td><td>384 GB <\/td><td>768 GB <\/td><\/tr><tr><td>Speicherschnittstelle<\/td><td>HBM3e \/ LPDDR5X<\/td><td>512-Bit-GDDR7<\/td><td>GDDR7<\/td><td>GDDR7<\/td><\/tr><tr><td>Speicherbandbreite<\/td><td>7,1 TB\/s bei 252 GB HBM3e<br>396 GB\/s bei 496 GB LPDDR5X<\/td><td>1,597 GB\/s<\/td><td>6,4 TB\/s insgesamt<\/td><td>12,8 TB\/s insgesamt<\/td><\/tr><tr><td>Stromverbrauch<\/td><td>System: bis zu 1.600 W<\/td><td>GPU: bis zu 600 W <\/td><td>GPUs: bis zu 2.400 W<\/td><td>GPUs: bis zu 4.800 W<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Bei der LLM-Inferenz gibt es zwei unterschiedliche Phasen: <\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Die Vorabf\u00fcllphase (das Laden der Benutzeraufforderung) ist rechenintensiv<\/li>\n\n\n\n<li>Die Dekodierungsphase (Erzeugung von Tokens) ist speichergebunden<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Wie wir sehen k\u00f6nnen, verf\u00fcgt die DGX Station GB300 \u00fcber <strong>mehr <\/strong>Rechenleistung, die der von 4 RTX PRO 6000 Server Edition-GPUs f\u00fcr FP4, FP8, FP16\/BF16 entspricht. Die FP4- und FP8-Leistung ist f\u00fcr die LLM-Inferenz von besonderer Bedeutung. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Allerdings \u00fcbertrifft bereits eine einzige RTX PRO 6000 die DGX Station GB300 Superchip sowohl bei der FP32- als auch bei der FP64-Leistung. Zudem verf\u00fcgt sie \u00fcber Raytracing-F\u00e4higkeiten, die der DGX Station GB300 fehlen. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Rein unter dem Gesichtspunkt der Rechenleistung \u00fcbertreffen 8x RTX PRO 6000 Blackwell Server Edition die DGX Station GB300 bei FP4, FP8, FP16\/BF16 und nat\u00fcrlich auch bei FP32 und FP64. Dies setzt jedoch eine Aufgabe voraus, bei der die GPUs gleichm\u00e4\u00dfig mit Rechenleistung ausgelastet werden k\u00f6nnen. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Bei wissenschaftlichen Anwendungen spielt die ben\u00f6tigte Rechengenauigkeit eine wichtige Rolle \u2013 f\u00fcr wissenschaftliche Anwendungen mit hoher Genauigkeit oder Rendering-Anwendungen sind die RTX PRO 6000 Server Edition-Grafikkarten die bessere Wahl. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In der Dekodierungsphase spielt die Speicherbandbreite eine entscheidende Rolle \u2013 auch hier \u00fcbertrifft die DGX Station GB300 vier RTX PRO 6000-GPUs und geht als klarer Sieger hervor \u2013 sie d\u00fcrfte eine h\u00f6here Leistung in Token pro Sekunde erzielen. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Bei 8x RTX PRO 6000-GPUs ist die Situation komplexer. Die Gesamt-Speicherbandbreite ist zwar h\u00f6her, jedoch kann es aufgrund der erforderlichen Kommunikation zwischen den GPUs \u00fcber die PCI-Express-Verbindung zu Verz\u00f6gerungen kommen. Mit den entsprechenden technischen Ma\u00dfnahmen lie\u00dfe sich der Durchsatz im Vergleich zur DGX Station GB300 steigern. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Zwei DGX Station GB300 sind ein starker Anw\u00e4rter f\u00fcr einen Vergleich. Zwei DGX Station GB300 werden \u00fcber eine noch h\u00f6here Gesamt-Speicherbandbreite von 14,2 TB\/s, eine h\u00f6here Rechenleistung, eine geringere Gesamtstromaufnahme und weniger Modell-Shards verf\u00fcgen. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">pi3g kann Ihnen dabei helfen, die f\u00fcr Sie am besten geeigneten vLLM-Inferenzserver zu finden.<\/p>\n\n\n\n<div class=\"wp-block-buttons is-content-justification-center is-layout-flex wp-container-core-buttons-is-layout-fe48e5de wp-block-buttons-is-layout-flex\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"\/de\/kontakt\/\">Wenden Sie sich an pi3g, um vLLM-Inferenzserver zu erwerben<\/a><\/div>\n<\/div>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Anmerkung:<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Der Int8-Leistungswert f\u00fcr den <a href=\"https:\/\/pi3g.com\/de\/nvidia-dgx-station-available-now-for-purchase-from-us\/\">DGX Station GB300<\/a> Die in NVIDIAs offiziellem Datenblatt angegebenen Werte stimmen nicht mit der Entwicklung bei FP8 und FP16 \u00fcberein. Ich w\u00fcrde erwarten, dass die Leistung der von FP8 \u00e4hnelt. 330 TOPS entsprechen dem Leistungsniveau einer Edge-Beschleunigerkarte. Der von Google angegebene Wert von 5.000 TFLOPS (sic) erscheint plausibler, d\u00fcrfte jedoch wahrscheinlich 5.000 TOPS lauten, da es sich hier um Int8 handelt.    <\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Referenzen:<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><a href=\"https:\/\/www.nvidia.com\/en-us\/products\/workstations\/dgx-station\/\">https:\/\/www.nvidia.com\/en-us\/products\/workstations\/dgx-station\/<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/www.nvidia.com\/en-eu\/data-center\/rtx-pro-6000-blackwell-server-edition\">https:\/\/www.nvidia.com\/en-eu\/data-center\/rtx-pro-6000-blackwell-server-edition<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/docs.cloud.google.com\/compute\/docs\/gpus\">https:\/\/docs.cloud.google.com\/compute\/docs\/gpus<\/a><\/li>\n<\/ul>\n\n\n\n<h1 class=\"wp-block-heading\">Modellanpassung, Skalierbarkeit und Leistung<\/h1>\n\n\n\n<p class=\"wp-block-paragraph\">Die DGX Station GB300 verf\u00fcgt \u00fcber einen gr\u00f6\u00dferen und schnelleren einheitlichen Speicherblock \u2013 252 GB ECC HBM3e mit einer Speicherbandbreite von 7,1 TB\/s \u2013 im Vergleich zu einer einzelnen NVIDIA RTX PRO 6000 Blackwell Server Edition-GPU. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Selbst bei einer Kombination aus vier RTX PRO 6000-Grafikprozessoren betr\u00e4gt deren gesamte Speicherbandbreite immer noch <strong>niedriger<\/strong> im Vergleich zur GPU-Speicherbandbreite der DGX Station GB300. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Je nach Ihrer Anwendung und Ihrem Modell k\u00f6nnen Sie die Optimierung auf unterschiedliche Aspekte ausrichten. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Es ist bekannt, dass die folgenden Modelle auf der DGX Station GB300 funktionieren:<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><tbody><tr><td><strong>Modellbezeichnung<\/strong><\/td><td><strong>Gr\u00f6\u00dfe<\/strong><\/td><td><strong>Architektur<\/strong><\/td><td><strong>Genauigkeit<\/strong><\/td><td><strong>DGX-Station<\/strong><\/td><td><strong>1x RTX Pro 6000<\/strong><\/td><td><strong>4x RTX Pro 6000<\/strong><\/td><td><strong>8x RTX Pro 6000<\/strong><\/td><\/tr><tr><td>NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16<\/td><td>30B\/3B<\/td><td>MoE<\/td><td>NVFP4<\/td><td>Ja<\/td><td>Ja <\/td><td>Ja<\/td><td>Ja<\/td><\/tr><tr><td>Schritt 3.7 \u2013 Blitzen<\/td><td>198B\/11B<\/td><td>MoE<\/td><td>BF16<\/td><td>Ja (FP8)<\/td><td><strong>keine<\/strong><\/td><td>Ja (FP8, EP)<\/td><td>Ja (EP)<\/td><\/tr><tr><td>DeepSeek-V4-Flash<\/td><td>284B\/13B<\/td><td>MoE<\/td><td>FP8<\/td><td>Ja (FP4)<\/td><td><strong>keine<\/strong><\/td><td>Ja (FP8, EP)<\/td><td>Ja (FP8, EP)<\/td><\/tr><tr><td>Qwen3.6-27B<\/td><td>27B<\/td><td>Dicht<\/td><td>BF16<\/td><td>Ja<\/td><td>Ja<\/td><td>Ja<\/td><td>Ja<\/td><\/tr><tr><td>Qwen3.6-35B-A3B<\/td><td>35B\/3B<\/td><td>MoE<\/td><td>BF16<\/td><td>Ja <\/td><td>Ja<\/td><td>Ja<\/td><td>Ja<\/td><\/tr><tr><td>MiniMax-M2.7<\/td><td>230B\/10B<\/td><td>MoE<\/td><td>FP8<\/td><td>Ja (FP8)<\/td><td><strong>keine<\/strong><\/td><td>Ja (FP8, EP)<\/td><td>Ja (FP8, EP)<\/td><\/tr><tr><td>gemma-4-26B-A4B-it<\/td><td>26 B\/4B<\/td><td>MoE<\/td><td>BF16<\/td><td>Ja<\/td><td>Ja<\/td><td>Ja<\/td><td>Ja<\/td><\/tr><tr><td>NVIDIA-Nemotron-3-Super-120B-A12B-BF16<\/td><td>120B\/12B<\/td><td>MoE<\/td><td>BF16<\/td><td>Ja<\/td><td>Ja (FP4)<\/td><td>Ja (EP)<\/td><td>Ja (EP)<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Hinweis: Aufgrund des Unified-Memory-Designs kann der Kontext bei der DGX Station in den CPU-Speicher geladen werden. Die Abk\u00fcrzung \u201eEP\u201c in der Tabelle steht f\u00fcr \u201eExpert Parallelism\u201c. <\/p>\n\n\n\n<div class=\"wp-block-buttons is-content-justification-center is-layout-flex wp-container-core-buttons-is-layout-fe48e5de wp-block-buttons-is-layout-flex\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"\/de\/kontakt\/\">Wenden Sie sich an pi3g, um vLLM-Inferenzserver zu erwerben<\/a><\/div>\n<\/div>\n\n\n\n<h2 class=\"wp-block-heading\">Expert Parallelism (EP) <\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Die heutigen Open-Weight-Modelle nutzen \u00fcberwiegend eine \u201eMixture of Experts\u201c-Architektur (MoE). Bei dieser Architektur sendet ein Router Token an eine kleine Anzahl ausgew\u00e4hlter Experten. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Im Falle der DGX Station passen alle Modelle aus der obigen Liste vollst\u00e4ndig in den schnellen GPU-Speicher, wobei die angegebene Genauigkeit verwendet wird. Der Router verursacht keine zus\u00e4tzliche PCIe-Latenz, und die Tokens m\u00fcssen zur Berechnung nicht an eine andere GPU weitergeleitet werden. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Zudem ist f\u00fcr die Modelle keine spezielle Sharding-Konfiguration erforderlich, was die Verwaltung und Entwicklung vereinfacht. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Bei RTX Pro 6000-GPUs m\u00fcssen die Experten verteilt werden, wobei in der Regel mehrere Experten auf jede GPU verteilt werden. Besondere Aufmerksamkeit muss der Zuordnung der Experten sowie den zus\u00e4tzlichen Latenzen gewidmet werden, die durch die Kommunikation zwischen den GPUs w\u00e4hrend der Inferenz entstehen.   <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Mit einer Gesamt-GPU-Speicherkapazit\u00e4t von bis zu 768 GB auf 8 RTX PRO 6000-GPUs k\u00f6nnen Sie Modelle mit h\u00f6herer Pr\u00e4zision laden. Die DGX Station verf\u00fcgt insgesamt \u00fcber 748 GB Speicher, allerdings ist ihr CPU-Speicher viermal langsamer als der Speicher einer einzelnen RTX PRO 6000. Die Bandbreite ist dabei von gr\u00f6\u00dferer Bedeutung. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Datenparallelit\u00e4t<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\"> Im Falle der Datenparallelit\u00e4t wird dasselbe Modell auf mehreren GPUs ausgef\u00fchrt, wobei die Daten auf diesen GPUs parallel verarbeitet werden.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Da vier RTX PRO 6000-Karten bei allen relevanten Messgr\u00f6\u00dfen (Rechenleistung f\u00fcr FP4, FP8, FP16\/BF16 sowie Speicherbandbreite) schlechter abschneiden als die DGX Station GB300 und zudem ein zus\u00e4tzlicher PCIe-Overhead anf\u00e4llt, w\u00fcrden Sie sich selbst ins Bein schie\u00dfen, wenn Sie versuchen w\u00fcrden, auf diese Weise Datenparallelit\u00e4t zu erreichen. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Die Gesamtleistung und die Speicherbandbreite von 8x RTX PRO 6000 sind h\u00f6her. Unter den richtigen Bedingungen kann dies zu einem h\u00f6heren Durchsatz an Token pro Sekunde f\u00fchren. Allerdings sollte dies sorgf\u00e4ltig mit der Leistung von 2x DGX Station GB300-Systemen verglichen werden, insbesondere im Hinblick auf den geringeren Stromverbrauch. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Tensor-Parallelit\u00e4t <\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Bei der Tensor-Parallelit\u00e4t verarbeitet jede GPU einen Teil jeder Schicht und berechnet ein Teilergebnis, das anschlie\u00dfend wieder zusammengef\u00fcgt werden muss. Die erforderliche Synchronisation zwischen den GPUs ist sehr datenintensiv. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In der Regel sind NVLink und eine direkte GPU-zu-GPU-Kommunikation erforderlich, damit dies reibungslos funktioniert. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Da die RTX PRO 6000 nicht \u00fcber eine NVLink-Option verf\u00fcgt, raten wir davon ab, auf diesen Karten Tensor-Parallelit\u00e4t zu nutzen. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Pipeline-Parallelit\u00e4t<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Die verschiedenen Ebenen werden auf unterschiedlichen GPUs ausgef\u00fchrt, die wie ein Flie\u00dfband miteinander verkettet sind. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dies eignet sich gut f\u00fcr Multi-GPU-Cluster, wie beispielsweise 8x RTX PRO 6000 Blackwell, und k\u00f6nnte dazu f\u00fchren, dass dieser GPU-Cluster die DGX Station GB300 an Leistung \u00fcbertrifft. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Redundanz<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Die DGX Station GB300 verf\u00fcgt \u00fcber ein einziges Netzteil, eine einzige GPU und eine einzige CPU. Dies sind einzelne Ausfallquellen. Ein Serversystem mit 4 oder 8 RTX Pro 6000 Blackwell-GPUs ist ausfallsicherer und weist im Falle eines Ausfalls nur eine allm\u00e4hliche Leistungsminderung auf, anstatt vollst\u00e4ndig auszufallen.  <\/p>\n\n\n\n<h2 class=\"wp-block-heading\">x86 \/ CPU \/ CPU-Arbeitsspeicher<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ein letzter Aspekt, den wir bei unserem Vergleich ber\u00fccksichtigen m\u00fcssen, ist die CPU-Architektur der Systeme. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Die DGX Station nutzt ARM-Kerne. Da x86 in der Serverwelt als De-facto-Standard gilt, m\u00fcssten einige \u00e4ltere Anwendungen neu kompiliert oder portiert werden. Die Kompatibilit\u00e4t k\u00f6nnte ein Problem darstellen. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Der in diesem Server verwendete AMD EPYC verf\u00fcgt \u00fcber eine h\u00f6here Speicherbandbreite \u2013 pro CPU und nat\u00fcrlich auch insgesamt f\u00fcr beide zusammen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Je nach Aufgabenstellung k\u00f6nnten zus\u00e4tzliche Verarbeitungsschritte auf die CPU-Kerne verlagert werden, was unter Umst\u00e4nden die insgesamt bessere L\u00f6sung darstellt. Wir empfehlen Ihnen daher, Ihre Anwendung ganzheitlich zu betrachten, um die f\u00fcr Sie am besten geeignete L\u00f6sung zu ermitteln. <\/p>\n\n\n\n<div class=\"wp-block-buttons is-content-justification-center is-layout-flex wp-container-core-buttons-is-layout-fe48e5de wp-block-buttons-is-layout-flex\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"\/de\/kontakt\/\">Wenden Sie sich an pi3g, um LLM-Inferenzserver zu erwerben<\/a><\/div>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>Die NVIDIA DGX Station GB300 ist ein interessantes Angebot f\u00fcr Teams, die auf Cloud-Unabh\u00e4ngigkeit angewiesen sind. Sie ist in erster Linie f\u00fcr den Einsatz im B\u00fcro konzipiert und zeichnet sich als relativ leises Ger\u00e4t mit einem 1.600-W-Netzteil aus. Einige Teams haben jedoch auch die M\u00f6glichkeit, ihre eigenen Server in einem Rechenzentrum zu betreiben. Daher ist es sinnvoll, die NVIDIA DGX\u2026<\/p>","protected":false},"author":2,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","_links_to":"","_links_to_target":""},"categories":[1096,1047,1067,1087],"tags":[1104,1069,1107,1106,1068,1081],"class_list":["post-32065","post","type-post","status-publish","format-standard","hentry","category-ai-development-services","category-ai-hardware","category-nvidia-ai-hardware","category-nvidia-dgx-station","tag-comparison","tag-dgx-station","tag-models","tag-moe","tag-nvidia","tag-nvidia-dgx-station"],"_links":{"self":[{"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/posts\/32065","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/comments?post=32065"}],"version-history":[{"count":13,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/posts\/32065\/revisions"}],"predecessor-version":[{"id":32078,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/posts\/32065\/revisions\/32078"}],"wp:attachment":[{"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/media?parent=32065"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/categories?post=32065"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/tags?post=32065"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}