{"id":32091,"date":"2026-08-25T16:27:26","date_gmt":"2026-08-25T14:27:26","guid":{"rendered":"https:\/\/pi3g.com\/?p=32091"},"modified":"2026-08-25T16:27:29","modified_gmt":"2026-08-25T14:27:29","slug":"ollama-vs-vllm-on-dgx-spark-for-software-engineering","status":"publish","type":"post","link":"https:\/\/pi3g.com\/de\/ollama-vs-vllm-on-dgx-spark-for-software-engineering\/","title":{"rendered":"Ollama vs. vLLM auf DGX Spark f\u00fcr die Softwareentwicklung"},"content":{"rendered":"<p class=\"wp-block-paragraph\">Dass man gro\u00dfe Sprachmodelle wie Ollama und vLLM lokal auf leistungsstarker Entwickler-Workstation-Hardware wie der NVIDIA DGX Spark ausf\u00fchren kann, ist eine der spannendsten Hardware-Entwicklungen, die ich seit l\u00e4ngerer Zeit gesehen habe. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Der DGX Spark ist eine sehr interessante Hardware mit 128 GB vereinheitlichtem Speicher. Hinsichtlich der Bandbreite ist er zwar nicht der preisbezogen schnellste Chipsatz auf dem Markt (ein Mac Studio ist theoretisch dreimal so schnell), jedoch verf\u00fcgt er \u00fcber eine unerreichte Speichertiefe, sodass theoretisch ein auf 4-Bit quantisiertes Modell mit 70 Milliarden Parametern auf ihm Platz findet. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dies wirft jedoch eine Frage f\u00fcr den angehenden \u201cLocal-only\u201d-Softwareentwickler auf. Welches Modell funktioniert am besten, wenn man sich bei Programmieraufgaben gerade erst in lokale LLMs einarbeitet?<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Die beiden popul\u00e4ren Optionen, die die lokale LLM-Ininference heute dominieren, sind Ollama und vLLM. W\u00e4hrend beide hervorragend darin sind, Open-Weight-Modelle lokal auszuf\u00fchren, dienen sie meiner Erfahrung nach grundlegend unterschiedlichen Arbeitsabl\u00e4ufen und Leistungszielen. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In diesem Artikel m\u00f6chte ich meine Erfahrungen mit dem Betrieb beider Inferenz-Server auf dem Spark im August 2026 teilen und erl\u00e4utern, welches Alltagsmodell ich f\u00fcr die Programmierung ausgew\u00e4hlt habe.<\/p>\n\n\n\n<div class=\"wp-block-buttons is-content-justification-center is-layout-flex wp-container-core-buttons-is-layout-fe48e5de wp-block-buttons-is-layout-flex\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"\/de\/kontakt\/\">Wenden Sie sich an pi3g, um LLM-Inferenzserver zu erwerben<\/a><\/div>\n<\/div>\n\n\n\n<h3 class=\"wp-block-heading\">Eine kurze Bemerkung: Warum NVIDIA NIM nicht in diesem Vergleich enthalten ist<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Bevor wir uns in das Thema vertiefen, fragen Sie sich m\u00f6glicherweise, warum NVIDIA NIM (Inference Microservices) nicht auf dieser Liste steht. Zwar ist NIM eine beeindruckende Unternehmensl\u00f6sung, die f\u00fcr Produktionscluster und Cloud-Bereitstellungen entwickelt wurde, jedoch bringt sie \u00dcberlegungen zur Unternehmenslizenzierung, den Overhead der NGC-Registry und strikte containerbasierte Arbeitsabl\u00e4ufe mit sich. Als lokaler Entwickler, der auf dedizierter Hardware baut und testet, ben\u00f6tige ich derzeit keine Orchestrierung im Cloud-Ma\u00dfstab, um meine Arbeit zu erledigen. Ollama und vLLM geben mir die volle, uneingeschr\u00e4nkte Kontrolle \u00fcber meinen Arbeitsablauf ohne externe Abh\u00e4ngigkeiten.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">Ollama ist sehr einfach zu installieren und auszuf\u00fchren. <\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ollama hat sich zum Standard-Einstiegspunkt f\u00fcr die lokale Ausf\u00fchrung von LLMs entwickelt, und das aus gutem Grund. Unter der Haube nutzt Ollama&nbsp;<code>llama.cpp<\/code>&nbsp;Bereitstellung eines sauberen, entwicklerzentrierten Wrappers, der Low-Level-C++-Bindings, Quantisierungskonfigurationen und die Speicherverwaltung abstrahiert.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Kernkompetenzen<\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Reibungsfreie CLI &amp; API:<\/strong>&nbsp;Die Inbetriebnahme eines Modells ist so einfach wie&nbsp;<code>ollama, f\u00fchren Sie llama3 aus<\/code>. Es ruft Gewichte automatisch ab, \u00fcbernimmt die Quantisierung (GGUF) und stellt eine OpenAI-kompatible HTTP-API unter&nbsp;<code>localhost:11434<\/code>.<\/li>\n\n\n\n<li><strong>Geringer Platzbedarf im Leerlauf:<\/strong>&nbsp;Ollama entl\u00e4dt Modelle aus dem Speicher, wenn keine Aktivit\u00e4t vorliegt (\u00fcber ein Timeout konfigurierbar), wodurch GPU-VRAM f\u00fcr andere lokale Aufgaben freigegeben wird.<\/li>\n\n\n\n<li><strong>Model-Management:<\/strong>&nbsp;Mit Modelldateien k\u00f6nnen Sie Systemaufforderungen, Temperaturstandardwerte und Kontextl\u00e4ngen \u00fcbersichtlich in einer einzigen Konfigurationsdatei anpassen.<\/li>\n<\/ul>\n\n\n\n<h3 class=\"wp-block-heading\">Einschr\u00e4nkungen<\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Geringerer Durchsatz bei gleichzeitiger Nutzung:<\/strong>&nbsp;Da es sich auf&nbsp;<code>llama.cpp<\/code>\u2018Was die Architektur betrifft, so bew\u00e4ltigt Ollama interaktive Eingabeaufforderungen f\u00fcr einzelne Benutzer hervorragend, zeigt jedoch Leistungseinbu\u00dfen, wenn es mit einer hohen Anzahl gleichzeitiger Anfragen \u00fcberlastet wird.<\/li>\n\n\n\n<li><strong>Eingeschr\u00e4nkte erweiterte KV-Cache-Steuerung:<\/strong>&nbsp;Sie haben weniger direkte Kontrolle \u00fcber benutzerdefinierte PagedAttention-, KV-Cache-Quantisierung- oder Tensorparallellismus-Parameter.<\/li>\n<\/ul>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">2. vLLM ist in Mehrbenutzersituationen wesentlich schneller<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">vLLM wurde von Forschern der UC Berkeley speziell entwickelt, um Speicherengp\u00e4sse beim Betrieb von LLMs mit hoher Parallelit\u00e4t zu beheben. Basierend auf&nbsp;<strong>PagedAttention<\/strong>, vLLM verwaltet den Attention-Key-Value-Speicher (KV) in \u00e4hnlicher Weise, wie ein Betriebssystem den virtuellen Speicher mittels Paging verwaltet.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Kernkompetenzen<\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Unvergleichliche Parallelit\u00e4t und Durchsatz:<\/strong>&nbsp;Durch \u201ePagedAttention\u201c und kontinuierliches Batching erzielt vLLM bei Mehrbenutzer- oder parallelen Anforderungslasten einen 2- bis 4-mal h\u00f6heren Durchsatz im Vergleich zu herk\u00f6mmlichen Serving-Engines.<\/li>\n\n\n\n<li><strong>Native Hugging-Face-Integration:<\/strong>&nbsp;Sie k\u00f6nnen vLLM direkt auf Standard-Repository-IDs von Hugging Face oder auf lokale Verzeichnisse mit unquantisierten bzw. quantisierten Safetensors verweisen, ohne die Gewichte zuvor in GGUF konvertieren zu m\u00fcssen.<\/li>\n\n\n\n<li><strong>Detaillierte architektonische Steuerung:<\/strong>&nbsp;Erm\u00f6glicht eine pr\u00e4zise Abstimmung der Tensorparallelit\u00e4t (<code>--tensor-parallel-size<\/code>), maximale Modellkontextl\u00e4ngen, prozentuale Speicherauslastung des KV-Cache (<code>--GPU-Speicherauslastung<\/code>) sowie spekulative Dekodierung.<\/li>\n<\/ul>\n\n\n\n<h3 class=\"wp-block-heading\">Einschr\u00e4nkungen<\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>H\u00f6herer Aufwand bei der Einrichtung und h\u00f6herer Speicherbedarf:<\/strong>&nbsp;vLLM reserviert beim Start GPU-Speicher f\u00fcr seinen KV-Cache, wodurch selbst im Leerlauf betr\u00e4chtliche Mengen an VRAM belegt werden.<\/li>\n\n\n\n<li><strong>Entwickler-Ergonomie<\/strong>&nbsp;F\u00fcr die Einrichtung von vLLM sind eine Python-Umgebung, CUDA-Abh\u00e4ngigkeiten oder die Verwaltung von Docker-Containern erforderlich \u2013 es handelt sich also nicht um ein einfaches Installationsprogramm mit einer einzigen Bin\u00e4rdatei.<\/li>\n<\/ul>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">Vergleichstabelle zwischen Ollama und vLLM f\u00fcr die Programmierung <\/h2>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><thead><tr><th class=\"has-text-align-left\" data-align=\"left\">Merkmal<\/th><th class=\"has-text-align-left\" data-align=\"left\">Ollama<\/th><th class=\"has-text-align-left\" data-align=\"left\">vLLM<\/th><\/tr><\/thead><tbody><tr><td><strong>Prim\u00e4re Kern-Engine<\/strong><\/td><td><code>llama.cpp<\/code><\/td><td>PyTorch \/ PagedAttention<\/td><\/tr><tr><td><strong>Modellgewichtungsformate<\/strong><\/td><td>GGUF (Quantisiert)<\/td><td>Safetensors, AWQ, GPTQ, FP8, Unquantisiert<\/td><\/tr><tr><td><strong>Hauptanwendungsfall<\/strong><\/td><td>Lokales Skripting, Einzelbenutzer-Entwicklung, schnelles Prototyping<\/td><td>Mandantenf\u00e4hige lokale API, Stapelverarbeitung, Produktionstore<\/td><\/tr><tr><td><strong>Parallele Anforderungssammlung<\/strong><\/td><td>Einfach (sequenziell \/ in der Warteschlange)<\/td><td>Kontinuierliches Batching + PagedAttention<\/td><\/tr><tr><td><strong>Einrichtungsaufwand<\/strong><\/td><td>Einzeiliges Installationsprogramm \/ CLI<\/td><td>Python-Paket<code>pip install vllm<\/code>) oder Docker<\/td><\/tr><tr><td><strong>Kompatibilit\u00e4t mit der OpenAI-API<\/strong><\/td><td>Ja (<code>\/v1\/chat\/completions<\/code>)<\/td><td>Ja (<code>\/v1\/chat\/completions<\/code>)<\/td><\/tr><tr><td><strong>VRAM-Verwaltung<\/strong><\/td><td>Dynamisches Laden und Entladen nach Bedarf<\/td><td>Vorallokierter KV-Cache-Pool<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<div class=\"wp-block-buttons is-content-justification-center is-layout-flex wp-container-core-buttons-is-layout-fe48e5de wp-block-buttons-is-layout-flex\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"\/de\/kontakt\/\">Wenden Sie sich an pi3g, um LLM-Inferenzserver zu erwerben<\/a><\/div>\n<\/div>\n\n\n\n<h2 class=\"wp-block-heading\">Welches sollten Sie f\u00fcr lokale Programmieraufgaben w\u00e4hlen?<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\">Entscheiden Sie sich f\u00fcr Ollama, wenn:<\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Sie w\u00fcnschen sich eine sofortige, reibungslose Einrichtung, um Prompts zu testen, lokale Skripte zu schreiben oder agentische Schleifen auf Ihrem Rechner zu erstellen.<\/li>\n\n\n\n<li>Sie f\u00fchren Ein-Benutzer-Workflows durch, bei denen die Zeit bis zum ersten Token (TTFT) f\u00fcr den interaktiven Chat von entscheidender Bedeutung ist.<\/li>\n\n\n\n<li>Sie bevorzugen leichtgewichtige, quantisierte GGUF-Modelle, um den Speicherbedarf zu minimieren und im Leerlauf VRAM freizuhalten.<\/li>\n<\/ul>\n\n\n\n<h3 class=\"wp-block-heading\">W\u00e4hlen Sie vLLM, wenn:<\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Sie machen Ihren DGX Spark zu einem lokalen Netzwerk-API-Server f\u00fcr ein Team oder mehrere interne Dienste.<\/li>\n\n\n\n<li>Sie f\u00fchren umfangreiche Batch-Auswertungsauftr\u00e4ge, Benchmark-Suiten oder Skripte zur Erzeugung synthetischer Daten aus, die Dutzende paralleler Anfragen senden.<\/li>\n\n\n\n<li>Sie arbeiten direkt mit Gewichten im Hugging-Face-Format, benutzerdefinierten Feinabstimmungen oder erweiterten FP8-\/AWQ-Quantisierungsschemata, ohne diese in das GGUF-Format zu konvertieren.<\/li>\n<\/ul>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<div class=\"wp-block-cover\" style=\"min-height:221px;aspect-ratio:unset;\"><img loading=\"lazy\" decoding=\"async\" width=\"2048\" height=\"1536\" class=\"wp-block-cover__image-background wp-image-32095\" alt=\"\" src=\"https:\/\/pi3g.com\/wp-content\/uploads\/2026\/08\/image-2.png\" data-object-fit=\"cover\" srcset=\"https:\/\/pi3g.com\/wp-content\/uploads\/2026\/08\/image-2.png 2048w, https:\/\/pi3g.com\/wp-content\/uploads\/2026\/08\/image-2-300x225.png 300w, https:\/\/pi3g.com\/wp-content\/uploads\/2026\/08\/image-2-16x12.png 16w, https:\/\/pi3g.com\/wp-content\/uploads\/2026\/08\/image-2-768x576.png 768w, https:\/\/pi3g.com\/wp-content\/uploads\/2026\/08\/image-2-1024x768.png 1024w, https:\/\/pi3g.com\/wp-content\/uploads\/2026\/08\/image-2-1536x1152.png 1536w\" sizes=\"auto, (max-width: 2048px) 100vw, 2048px\" \/><span aria-hidden=\"true\" class=\"wp-block-cover__background has-background-dim\"><\/span><div class=\"wp-block-cover__inner-container is-layout-flow wp-block-cover-is-layout-flow\">\n<p class=\"has-text-align-center has-large-font-size wp-block-paragraph\"><\/p>\n<\/div><\/div>\n\n\n\n<h2 class=\"wp-block-heading\">Das Modell, das ich tats\u00e4chlich t\u00e4glich verwende, ist \u2026 Qwen 3.8 27B<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Als ich den DGX Spark zum ersten Mal erhielt, freute ich mich sehr darauf, mehrere verschiedene gr\u00f6\u00dfere Modelle zu testen und aus erster Hand Erfahrungen mit den Feinheiten der einzelnen Modelle zu sammeln \u2013 was jedes Modell zu bieten hat und wie sich unterschiedliche Quantisierungen auf die Funktionalit\u00e4t auswirken.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In der Praxis ist mein Alltagsauto derzeit&nbsp;<strong>Qwen 3.8 27B<\/strong>&nbsp;in Kombination mit einem DeepSeek-Codierungs-Harness. Standardm\u00e4\u00dfig neigt es dazu, Dinge zu sehr zu \u00fcberdenken, was die Token-Generierung etwas verlangsamt, doch es ist au\u00dferordentlich leistungsf\u00e4hig, wenn es darauf ankommt, Anweisungen strikt zu befolgen. Intuitiv f\u00fchlt es sich in Bezug auf Nuancen oder umfassendes Wissen \u00fcber die reale Welt wie eine leichte Verschlechterung gegen\u00fcber 3.6 35B an, doch aufgrund seiner Pr\u00e4zision bei Programmieraufgaben ist es meine erste Wahl.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dieser praxisnahe Arbeitsablauf hat letztendlich meine Art und Weise gepr\u00e4gt, wie ich beide Inferenzmaschinen nutze:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Ollama f\u00fcr die Exploration:<\/strong>&nbsp;Jedes Mal, wenn ich ein neues Modell testen, mit einer Architekturoption experimentieren oder Quantisierungsstufen vergleichen m\u00f6chte, starte ich es in Ollama. Der Workflow mit nur einem Befehl erm\u00f6glicht es mir, Evaluierungen durchzuf\u00fchren, ohne Systemkonfigurationen anr\u00fchren zu m\u00fcssen.<\/li>\n\n\n\n<li><strong>vLLM f\u00fcr den Alltagsverkehr:<\/strong>&nbsp;Nachdem ich mich f\u00fcr Qwen 3.8 27B als mein Hauptmodell entschieden hatte, richtete ich es so ein, dass es dauerhaft \u00fcber vLLM bereitgestellt wird. Dadurch bleibt meine zentrale Programmier-API schnell, stabil und jederzeit f\u00fcr mein Editor-Harness einsatzbereit.<\/li>\n<\/ul>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<p class=\"wp-block-paragraph\">Solange die Innovation weiterhin so rasant voranschreitet und ich das Bed\u00fcrfnis habe, kontinuierlich neue Modelle zu evaluieren, werde ich Ollama behalten. Der All-in-One (AIO) Open WebUI-Container k\u00f6nnte nicht einfacher und schneller einzurichten sein. Unten finden Sie meine Docker-Konfigurationen:<\/p>\n\n\n\n<pre class=\"wp-block-code\"><code>Dienste:\n  vllm-server:\n    Image: vllm\/vllm-openai:latest\n    Containername: vllm-server\n    ipc: host\n    ulimits:\n      memlock: -1\n      stack: 67108864\n    Ports:\n      - \"8000:8000\"\n    Umgebung:\n      # Geben Sie Ihr tats\u00e4chliches Token direkt in die folgenden Anf\u00fchrungszeichen ein\n      - HF_TOKEN=&quot;Ihr Token hier&quot;\n    volumes:\n      - \/root\/.cache\/huggingface\/hub:\/root\/.cache\/huggingface\/hub\n    deploy:\n      resources:\n        reservations:\n          devices:\n            - driver: nvidia\n              count: all\n              capabilities: [gpu]\n    Befehl:\n      - \"--model\"\n      - \"Inferact\/Qwen3.8-27B-NVFP4\"\n      - \"--gpu-memory-utilization\"\n      - \"0,5\"\n      - \"--tensor-parallel-size\"\n      - \"1\"\n      # - \"--max-model-len\"\n      # - \"32768\"\n      - \"--enable-chunked-prefill\"\n      # - \"--max-num-batched-tokens\"\n      # - \"8192\"\n      - \"--kv-cache-dtype\"\n      - \"fp8\"\n      - \"--reasoning-parser\"\n      - \"qwen3\"\n      - \"--enable-auto-tool-choice\"\n      - &quot;--tool-call-parser&quot;\n      - &quot;qwen3_coder&quot;\n    restart: unless-stopped\n    \n    \n  open-webui:\n    image: ghcr.io\/open-webui\/open-webui:ollama\n    container_name: open-webui\n    restart: always\n    environment:\n      - OLLAMA_HOST=0.0.0.0\n      - OLLAMA_ORIGINS=*\n      - WEBUI_COOKIE_SECURE=False\n    ports:\n      - \"8080:8080\"\n      - 11434:11434\n    volumes:\n      - open-webui:\/app\/backend\/data\n      - open-webui-ollama:\/root\/.ollama\n    Bereitstellung:\n      Ressourcen:\n        Reservierungen:\n          Ger\u00e4te:\n            - Treiber: nvidia\n              Anzahl: alle\n              F\u00e4higkeiten: [gpu]\n<\/code><\/pre>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Zusammenfassung:<\/em>\u00a0Beginnen Sie mit Ollama f\u00fcr die t\u00e4gliche Erfassung lokaler Daten, die Erstellung von Prototypen und die Erkundung. Wechseln Sie zu vLLM, sobald Sie mehrere Kunden gleichzeitig bedienen oder die Leistung bei der Batch-Inferenz voll aussch\u00f6pfen m\u00f6chten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>","protected":false},"excerpt":{"rendered":"<p>Getting to run large language models like Ollama and vLLM locally on powerful developer workstation hardware like the NVIDIA DGX Spark is one of the most exciting hardware developments I&#8217;ve seen in quite a while. The DGX Spark is a very cool piece of hardware with 128gb of unified memory. Its not the fastest possible&hellip;<\/p>","protected":false},"author":865,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","_links_to":"","_links_to_target":""},"categories":[1067,1087],"tags":[1074,1069,1068],"class_list":["post-32091","post","type-post","status-publish","format-standard","hentry","category-nvidia-ai-hardware","category-nvidia-dgx-station","tag-dgx-spark","tag-dgx-station","tag-nvidia"],"_links":{"self":[{"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/posts\/32091","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/users\/865"}],"replies":[{"embeddable":true,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/comments?post=32091"}],"version-history":[{"count":3,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/posts\/32091\/revisions"}],"predecessor-version":[{"id":32096,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/posts\/32091\/revisions\/32096"}],"wp:attachment":[{"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/media?parent=32091"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/categories?post=32091"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/pi3g.com\/de\/wp-json\/wp\/v2\/tags?post=32091"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}