Du anropar en modells API och varje körning ger ett nytt resultat — ibland precis rätt, ibland helt ute i det blå, och du vet inte var i prompten du ska ändra för att få det stabilt.
Din app "funkar", men token-notan bara växer, svarstiden hoppar, och du vill låta AI svara utifrån företagets interna dokument men vet inte var RAG ens börjar.
Värst av allt: appen blir tyst sämre utan att du märker det, för du har ingen utvärdering som mäter det — och du hårdkodar fortfarande API-nyckeln i koden, med en gnagande oro för dagen den läcker ut.