// ai engineering · malmö, sverige

AI-system som klarar mötet med produktion

Alla har en demo. Vi bygger det som kommer efter: retrieval ni kan lita på, utvärdering ni kan mäta, guardrails ni kan försvara och infrastruktur ni har råd med.

client requests
llm gateway
routing · caching · budgets per team
cache hit
~0 cost, instant
vllm on gpu
autoscale, scale-to-zero
evals in ci
gates every release
Evalsföre optimering, alltid
€/reqkostnad mätt per funktion, inte per månad
EUkoll på datalagring och AI-förordningen
K8sGPU-workloads på ert eget kluster vid behov

// vad vi gör

Ingenjörsarbetet bakom en användbar AI-funktion

Vi angriper AI från infrastruktursidan: modellen är en komponent i ett system som också behöver data, utvärdering, observability, kostnadskontroll och en ägare.

01

Från prototyp till produktion

De flesta AI-projekt dör mellan en snygg demo och ett pålitligt system. Vi tar demon, bygger utvärdering, guardrails, observability och kostnadskontroll runt den, och skeppar den.

02

RAG som faktiskt fungerar

Chunkningsstrategi, hybrid search, reranking, färskhet och källhänvisning. Det är kvaliteten på retrieval, inte vilken modell ni valt, som avgör om en assistent går att lita på.

03

Agenter och verktygsanvändning

Begränsade agenter med typade verktyg, deterministiska fallbacks, budgetgränser och mänsklig godkännande där det spelar roll. Autonomi där den lönar sig, guardrails överallt annars.

04

Utvärdering och kvalitetsgrindar

Golden datasets, LLM-as-judge med manuella stickprov, regressionstester i CI. Kan ni inte mäta en förändring kan ni inte heller uppgradera en modell tryggt.

05

LLM-plattform och gateway

En gemensam gateway för routing, caching, rate limits, nyckelhantering, budgetar per team och audit logs, så att inte varje produktteam integrerar leverantörer på egen hand.

06

Inferensinfrastruktur

GPU-node pools på Kubernetes, vLLM eller Ollama för self-hostade modeller, autoscaling till noll, och en ärlig jämförelse mot att bara betala en API-leverantör.

07

AI i utvecklarflödet

Kodassistenter, review-bottar och genererade tester, införda med policy, hantering av secrets och mätning, så att produktivitetspåståendet faktiskt går att kontrollera.

08

Governance och EU:s AI-förordning

Klassificering av use case, dokumentation av dataflöden, loggning och mänsklig tillsyn: det praktiska ingenjörsarbetet bakom compliance-pappren.

// arkitektur

En referensstack för LLM-applikationer

Inte alla projekt behöver alla lager, men att veta vilket lager ett problem hör hemma i är halva jobbet.

produkt
Chat / copilotBatch-berikningInterna verktyg
orkestrering
Prompt & verktygAgent runtimeGuardrails
kunskap
Vector storeHybrid searchReranker
gateway
Routing & cacheBudgetar & nycklarAudit log
runtime
Managed API:ervLLM på GPUKubernetes

// metod

Så tar vi ett AI-case till produktion

  1. 01Ramar inVäljer ett use case med mätbart värde och rimliga felscenarion.
  2. 02BaslinjeBygger den tråkiga versionen först, ofta slår sökning eller regler en LLM.
  3. 03UtvärderarGolden set och mätetal innan optimering, inte efter.
  4. 04HärdarGuardrails, hantering av personuppgifter, fallbacks, budgetar och rate limits.
  5. 05DriftarTraces, bevakning av drift, kostnad per request och en rutin för modelluppgraderingar.

// mognad

Mognadstrappan för AI

De flesta organisationer vi möter ligger någonstans mellan steg 1 och steg 2. Steget till steg 3 är mest plattformsarbete, och det går fint att lära sig.

steg 1

Experiment

Enskilda medarbetare använder chattverktyg privat. Ingen policy, ingen mätning och ingen koll på vilken data som lämnar huset.

steg 2

Första funktionen

En AI-funktion når användarna. Prompts ligger i koden, kvalitet bedöms på känsla och kostnaden är en överraskning på fakturan.

steg 3

Repeterbart

En gemensam gateway, utvärderingssviter och traces finns på plats. Ett andra team kan skeppa en AI-funktion utan att uppfinna hjulet igen.

steg 4

Styrt

Use case är klassificerade, dataflöden dokumenterade, mänsklig tillsyn definierad, och modelluppgraderingar är rutin snarare än risk.

steg 5

Sammansatt tillväxt

AI är en del av golden path: utvärdering i CI, budgetar per team, och retrieval-kvalitet som förbättras av verklig användningsdata.

// landskap

Vad en konsult bör kunna i AI-eran

Verktygen byts snabbt, men kategorierna står sig. Det här är de vi håller händerna i.

modeller
OpenAIAnthropicGoogle GeminiMistralLlamaQwen
orkestrering
LangGraphLlamaIndexVercel AI SDKModel Context ProtocolPydantic AI
retrieval
pgvectorQdrantOpenSearchElasticsearchBM25 + embeddings
serving
vLLMOllamaTGIKServeRay ServeNVIDIA GPU Operator
utvärdering
RagaspromptfooDeepEvalGolden datasetsLLM-as-judge
observability & drift
OpenTelemetry GenAILangfusePrometheusCost per request
säkerhet & governance
PII redactionPrompt-injection defenceOWASP LLM Top 10EU AI Act

// vår syn

Åsikter vi håller fast vid, tills motsatsen bevisas

De flesta AI-problem är dataproblem. Skillnaden mellan en oanvändbar assistent och en bra en är nästan alltid retrieval-kvalitet och innehållsstruktur, inte vilken toppmodell ni valde det här kvartalet.

Modellval borde vara en konfigparameter. Leverantörer springer om varandra var tredje månad. Bygg bakom en gateway så att ett byte blir en deploy, inte ett projekt.

Utvärdering är den riktiga vallgraven. Ett team med ett solitt golden dataset kan ta i bruk en ny modell på en dag. Ett team utan ett sådant gissar för evigt.

Agenter behöver minsta möjliga behörighet. Ge en agent verktyg på samma sätt som ni skulle ge en praktikant produktionsuppgifter: snävt, med loggning, och med ett godkännandesteg för allt som är irreversibelt.

// vanliga frågor

Frågor vi ofta får om AI

Ska vi self-hosta modeller eller använda ett API?

För de flesta team, börja med ett managed API och en gateway som gör det billigt att byta. Self-hosting lönar sig vid jämn hög volym, strikta krav på datalagring eller en finjusterad modell, och någon som kan driva GPU:erna.

Hur stoppar vi en AI-funktion från att hitta på saker?

Förankra svar i hämtade källor, kräv källhänvisning, begränsa output med scheman, och lägg till en väg för att avstå från svar. Mät sedan: ett golden dataset med förväntade svar gör hallucination till ett tal ni kan driva ner, inte bara en känsla.

Vad betyder EU:s AI-förordning för oss i praktiken?

I stort: vet vilka av era use case som är högrisk, dokumentera dataflöden och modellbeslut, spara loggar, och se till att en människa kan gripa in. Nästan allt av det är ingenjörsarbete vi kan hjälpa till att implementera, inte pappersarbete.

Våra AI-kostnader är oförutsägbara. Går det att fixa?

Ja. Caching, mindre modeller för enkla fall, kortare prompts, gränser för streaming och budgetar per team i gatewayen sänker oftast kostnaden rejält utan att tumma på kvalitet där det spelar roll.

Är prompt injection en verklig risk?

Absolut. Varje agent med verktyg och tillgång till text ni inte kontrollerar behöver minsta möjliga behörighet, validering av output och godkännandesteg för allt som är irreversibelt. Vi ser det som ett säkerhetsproblem, inte ett formuleringsproblem för prompten.

// så jobbar vi

01 in i teamet
ert team, era verktyg
02 leverera
första ändringen i prod vecka ett
03 stabilisera
tester, dokumentation, runbooks
04 lämna över
ert team äger det

// kontakt

Sitter er AI-idé fast mellan demo och produktion?

Berätta vad ni försöker bygga så säger vi ärligt om AI är rätt verktyg för det.

kontor: Malmö · uppdrag i hela landet

Spamskyddat. Inga nyhetsbrev, någonsin.