Module C · E-discovery engine

Data hub

Ingest mailboxes, archives and raw exports. Parsing, OCR, deduplication and indexing run in parallel.

Documents indexed

1.24M98.6%

Across 5 review sets

Ingestion throughput

41k/hrlive

8 parser workers

Dedup savings

22.4%-268k docs

Exact + near-duplicate

Parsing errors

118needs review

Encrypted or corrupt sources

Drop evidence to ingest

PST, OST, MBOX, ZIP, PDF, XLSX and raw forensic images. Chain of custody is recorded per file.

Current job

68%

whitfield_mailbox.pst

214,882 docs · 18.4 GB

Ingestion queue

  • whitfield_mailbox.pst

    18.4 GB · 214,882 docs

    Parsing
  • anand_archive_2024.pst

    9.1 GB · 96,014 docs

    Complete
  • deal_room_export.zip

    3.7 GB · 12,402 docs

    Complete
  • legacy_scans_batch07.pdf

    1.2 GB · 0 docs

    Error

    OCR failed on 118 pages — encrypted source

  • finance_ledger_q1-q4.xlsx

    412 MB · 0 docs

    Queued

Parsing log

  • 18:04:12ERRORlegacy_scans_batch07.pdf — page 118: encrypted source, OCR skipped
  • 18:03:55WARNwhitfield_mailbox.pst — 412 items with malformed date headers, normalised
  • 18:01:20INFOdeal_room_export.zip — deduplication removed 3,118 exact copies
  • 17:58:03INFOanand_archive_2024.pst — indexing complete, 96,014 documents