Module C · E-discovery engine
Data hub
Ingest mailboxes, archives and raw exports. Parsing, OCR, deduplication and indexing run in parallel.
Documents indexed
1.24M98.6%
Across 5 review sets
Ingestion throughput
41k/hrlive
8 parser workers
Dedup savings
22.4%-268k docs
Exact + near-duplicate
Parsing errors
118needs review
Encrypted or corrupt sources
Drop evidence to ingest
PST, OST, MBOX, ZIP, PDF, XLSX and raw forensic images. Chain of custody is recorded per file.
Current job
68%
whitfield_mailbox.pst
214,882 docs · 18.4 GB
Ingestion queue
- Parsing
whitfield_mailbox.pst
18.4 GB · 214,882 docs
- Complete
anand_archive_2024.pst
9.1 GB · 96,014 docs
- Complete
deal_room_export.zip
3.7 GB · 12,402 docs
- Error
legacy_scans_batch07.pdf
1.2 GB · 0 docs
OCR failed on 118 pages — encrypted source
- Queued
finance_ledger_q1-q4.xlsx
412 MB · 0 docs
Parsing log
- 18:04:12ERRORlegacy_scans_batch07.pdf — page 118: encrypted source, OCR skipped
- 18:03:55WARNwhitfield_mailbox.pst — 412 items with malformed date headers, normalised
- 18:01:20INFOdeal_room_export.zip — deduplication removed 3,118 exact copies
- 17:58:03INFOanand_archive_2024.pst — indexing complete, 96,014 documents