Vector Databases (ChromaDB, Qdrant) Indexing
1Concept
Vector databases index millions of high-dimensional embeddings using Approximate Nearest Neighbor (ANN) algorithms (HNSW - Hierarchical Navigable Small World graphs), executing sub-millisecond similarity queries.
2Architecture Diagram
Query Vector ---> [ HNSW Index Graph ] ---> Instant Top-K Nearest Neighbors retrieved in 2ms!
3Code Example
Python 3.12
vector_db_sample = '''
# Conceptual Chroma / Qdrant vector database query pipeline
class MockVectorStore:
def __init__(self):
self.vectors = {}
def insert(self, doc_id: str, vector: list[float], metadata: dict):
self.vectors[doc_id] = (vector, metadata)
def query(self, query_vector: list[float], top_k: int = 2):
# HNSW graph query simulation
return ["doc_101", "doc_104"]
store = MockVectorStore()
store.insert("doc_101", [0.1, 0.2], {"title": "Auth Service"})
print(f"Top matches: {store.query([0.1, 0.2])}")
'''
print("=== Vector Database Architecture ===")
print(vector_db_sample.strip())4Expected Output
=== Vector Database Architecture ===
# Conceptual Chroma / Qdrant vector database query pipeline
class MockVectorStore:
def __init__(self):
self.vectors = {}
def insert(self, doc_id: str, vector: list[float], metadata: dict):
self.vectors[doc_id] = (vector, metadata)
def query(self, query_vector: list[float], top_k: int = 2):
# HNSW graph query simulation
return ["doc_101", "doc_104"]
store = MockVectorStore()
store.insert("doc_101", [0.1, 0.2], {"title": "Auth Service"})
print(f"Top matches: {store.query([0.1, 0.2])}")5Key Takeaways
- ✓HNSW graphs balance recall accuracy with logarithmic search latency.
- ✓Store document text and metadata alongside vector embeddings for fast retrieval.
- ✓Supports metadata filtering (e.g. `where={'tenant_id': 'corp_12'}`).