Skip to content

Performance Targets

HEBBS defines hard latency budgets for every operation. These are contractual targets — regressions beyond these thresholds block releases.

All targets are measured at p99 under load (1000 concurrent clients, 10M memories) unless otherwise noted.

Operationp50 Targetp99 TargetNotes
remember< 2 ms< 5 msExcludes embedding (amortized via batching)
recall (similarity)< 5 ms< 10 msHNSW query at 10M memories, ef_search=100
recall (temporal)< 2 ms< 5 msB-tree range scan
recall (causal)< 3 ms< 8 msBFS traversal, max depth 5
recall (analogical)< 8 ms< 15 msCombined HNSW + cross-entity graph
get< 1 ms< 2 msSingle-key RocksDB lookup
revise< 3 ms< 6 msWrite new version + update indexes
forget (single)< 2 ms< 5 msDelete from all indexes
forget (entity)variesvariesProportional to entity memory count
prime< 5 ms< 10 msPreload into OS page cache
embed (single)< 1 ms< 2 msSingle embedding on CPU
embed (batch 32)< 8 ms< 12 msAmortized: ~0.3ms per item
health< 0.5 ms< 1 msNo I/O
MetricTargetConfiguration
Remember (sustained)> 3,000/secCPU, batch embedding
Remember (sustained)> 10,000/secGPU (CUDA), batch embedding
Recall (concurrent)> 5,000/sec10M memories, similarity
Subscribe pushes> 1,000/secPer subscription stream

Embedding is the most variable cost. The targets assume batch amortization:

ModePer-Item LatencyBatch Size
CPU (single)1–2 ms1
CPU (batched)0.25–0.4 ms32
CoreML (Apple Silicon)0.1–0.3 ms32
CUDA (NVIDIA)0.05–0.15 ms32

Reflection runs in the background and is not subject to hot-path latency budgets. Targets are for overall pipeline completion:

MetricTarget
Cluster stage< 500 ms per 1000 memories
Propose stageDepends on LLM provider latency
Validate stage< 100 ms per insight candidate
Consolidate stage< 50 ms per validated insight
Full cycle (1000 memories)< 30 seconds (excluding LLM)

All targets are measured using:

  • Criterion benchmarks in the benches/ directory for micro-benchmarks
  • hebbs-bench CLI tool for end-to-end load testing
  • Prometheus histograms for production monitoring

A regression > 10% on any p99 target blocks the merge. See Running Benchmarks for how to measure.