Det kommer jo lidt an på hvilken skala vi snakker, men grundlæggende er setup til sådan noget følgende:
1) En crawler, som kan skanne hjemmesider og følge links på disse (se
http://en.wikipedia.org/wiki/Web_crawler for mere information) samt udlede information fra disse. 2) Full-index hvor
2) Full-text index hvor crawleren kan afleverer information, som den finder. Her kunne anvendes sådan noget som Lucene (
http://lucene.apache.org/) eller andre Full-text index systemer.
3) En front-end som kan søge i Full-text index.
Der vil typisk mellem punkt 1 og 2 ligge en pipe-line hvor dokumenterne fundet af crawleren bliver behandler. Den ønskede information isoleres (eksempelvis kun META data fra HTML dokumenter) og afleveres til Indexet.
Der findes selvsagt mange måder at strukturerer den slags på men ovenstående er et rimeligt simpelt bud.