Direct naar content

Een dashboard had dit niet opgelost

Waarom grip op Azure-kosten technische expertise vereist, niet alleen inzicht

In de vorige twee blogs beschreven we twee cases die op het eerste gezicht niets met elkaar te maken hebben. Een GPU die staat te wachten op data. En een RAG-omgeving (Retrieval-Augmented Generation) waarvan de zoekindex op de duurste tier draait, met redundantie die niemand nodig heeft. Twee technologieën, twee teams, twee factuurregels. Eén gemeenschappelijke oorzaak: het probleem was niet zichtbaar in een dashboard. En al helemaal niet oplosbaar met een dashboard. In deze blog legt Edco Wallet uit waarom inzicht zonder expertise je niet verder brengt.

Edco Wallet

Co-Founder & eigenaar
Edco Wallet - Co-Founder & eigenaar
Een dashboard had dit niet opgelost | Azure cloudkosten | OptimaData

De belofte van het FinOps-dashboard

De markt voor cloudkostenbeheer is de afgelopen jaren geëxplodeerd. Er zijn tientallen tools die je Azure-uitgaven visualiseren: per resource, per team, per tag, per dag. Mooie grafieken. Rode vlaggen bij onverwachte pieken. Aanbevelingen om onderbenutte VM’s te stoppen.

Die tools hebben waarde. Inzicht is de eerste stap. Maar inzicht is niet hetzelfde als begrip. En begrip is niet hetzelfde als oplossing.

Een dashboard toont je dat een GPU-VM €28 per uur kost en 55% benut wordt. Het vertelt je niet waarom de benutting op 55% blijft steken. Het toont je dat Azure AI Search €18.000 per maand kost. Het vertelt je niet dat drie van die euro’s op de vier worden besteed aan redundantie voor een index die herbouwbaar is uit lokale brondata.

Bij meerdere klanten die we hebben doorgelicht stond de Azure Cost Management-omgeving vol met aanbevelingen. Rightsizing, reserved instances, idle resources. Niets over I/O-starvation. Niets over Search-tier optimalisatie. Die patronen herken je alleen als je weet waar je naar moet kijken.

Het verschil tussen een kostenregel en een oorzaak

Neem de AI-starvation case. In het Azure-dashboard zag de organisatie het volgende: een dure ND-series VM die continu draaide, hoge kosten, en matige trainingssnelheid. De aanbeveling van de tool: overweeg een grotere instantie of reserved instance voor kostenbesparing.

Wat het dashboard niet zag: dat de GPU 40% van de tijd stond te wachten omdat trainingsdata rechtstreeks van standaard Blob Storage werd gelezen in plaats van vooraf naar lokale NVMe te worden geladen. Dat er geen asynchrone prefetching was geconfigureerd. Dat InfiniBand niet was geactiveerd voor de multi-node communicatie.

Dit zijn geen financiële inzichten. Dit zijn technische diagnoses. Ze vereisen kennis van GPU-architectuur, Azure storage-topologie en ML-trainingspipelines. Een dashboard levert die kennis niet. Een consultant die de omgeving begrijpt, wel.

Hetzelfde geldt voor de RAG-case. De factuur toonde een hoge Azure AI Search-kostenregel. De oorzaak zat in een combinatie van factoren: een verkeerde tier-keuze bij de pilotfase die nooit werd herzien, redundantie-instellingen die klakkeloos waren overgenomen uit een productieconfiguratie, en zoekopdrachten die te breed waren geconfigureerd waardoor de Search Service onnodig zwaar werd belast. Geen van die oorzaken staat in een dashboard. Alle drie zijn ze oplosbaar, maar alleen als je ze herkent.

Waarom aanbevelingen niet genoeg zijn

Moderne FinOps-tools genereren automatisch aanbevelingen. Stop deze VM. Verklein die schijf. Koop een reserved instance voor die workload. Nuttig, voor de gevallen waar de oplossing voor de hand ligt.

De duurste Azure-kostenposten zijn zelden de gevallen waar de oplossing voor de hand ligt. Ze zijn het gevolg van architectuurkeuzes die bij de initiële opzet logisch leken, maar in de productierealiteit niet meer kloppen. Van aannames over beschikbaarheid, redundantie en schaalbaarheid die nooit zijn getoetst. Van technische configuraties die suboptimaal zijn, maar pas zichtbaar worden als iemand er actief naar zoekt.

Een geautomatiseerde aanbeveling herkent geen I/O-bottleneck. Een dashboard signaleert geen verkeerd gekozen vectoralgoritme. Een rapport concludeert niet dat drie replica’s overbodig zijn omdat de brondata elders veilig staat.

Dat soort conclusies vereist iemand die de technologie begrijpt, de Azure-architectuur kent, en de verbinding legt tussen wat er technisch speelt en wat dat betekent voor de factuur.

De kloof tussen inzicht en actie

Er is een reden waarom OptimaSure tooling en consultancy combineert in plaats van alleen een dashboard aan te bieden.

De tool, CloudXcellence, geeft het inzicht. Welke resources draaien. Wat ze kosten. Waar anomalieën zitten, gebaseerd op het daadwerkelijke gebruik en verbruik. Ook vluchtige data wordt hierbij meegenomen voordat die voor altijd verdwijnt. Dat is de eerste laag, en die is onmisbaar. Zonder inzicht geen vertrekpunt.

De tweede laag, begrijpen wat die data betekent en wat je eraan doet, vereist expertise. Niet alleen Azure-kennis in het algemeen, maar domeinkennis over de specifieke workloads. AI-infrastructuur. Zoeksystemen. Databasearchitectuur. Back-uptopologie.

Dat is precies wat we in de cases uit deze blogreeks zagen. De organisatie met AI-starvation had al toegang tot Azure Monitor. Ze zagen de GPU-benutting. Wat ze misten was de interpretatie: dit is geen capaciteitsprobleem, maar net een stukje kennis dat ontbrak. Die interpretatie, en de bijbehorende interventie, kwam pas toen iemand met de juiste technische achtergrond naar de omgeving keek.

De organisatie met de RAG-omgeving van €18.000 per maand had ook dashboards. Ze zagen de kosten gespecificeerd per regel. Wat ze niet zagen was de combinatie van oorzaken die achter dat bedrag schuilging, en het feit dat een doordachte herinrichting de kosten met 90% kon terugbrengen.

Inzicht zonder expertise is als een bloeduitslag zonder dokter. Je ziet dat er iets niet klopt. Wat het is en wat je eraan doet, dat weet je pas als iemand ernaar kijkt die het begrijpt.

Wat dit betekent voor hoe je naar Azure-kosten kijkt

De les uit deze blogreeks, van Azure Backup tot AI-starvation en RAG-architectuur, is niet dat dashboards nutteloos zijn. Ze zijn onmisbaar als startpunt.

De les is dat de duurste problemen zich verschuilen achter kostenregels die er op het eerste gezicht normaal uitzien. Een GPU-VM die draait. Een zoekservice die actief is. Back-ups die worden gemaakt. Allemaal legitieme uitgaven, want het licht brandt. Totdat iemand de vraag stelt of ze ook de juiste uitgaven zijn.

Die vraag stellen, en het antwoord vinden, is mensenwerk. Het combineert financieel inzicht met technische expertise. Het eindigt niet bij een rapport, maar bij een concrete aanpassing in de omgeving die de factuur structureel verlaagt.

Dat is wat wij doen bij OptimaSure. Niet omdat dashboards niet werken. Maar omdat dashboards tonen wat er is en waar het licht brandt. Met de vraag wat er efficiënter kan, helpen we je graag.

Dit is de derde en afsluitende blog in onze reeks over verborgen Azure-kosten. Eerder verschenen: Je GPU staat te wachten over AI-starvation en I/O-bottlenecks, en Van zoekindex naar rekening over Azure AI Search-tiers en RAG-architectuur.

Herken je dit patroon in je eigen Azure-omgeving? OptimaSure combineert tooling met hands-on technische expertise. Geen rapport zonder actie. Neem contact op

Interessante blogs

FinOps blog
Secret Link