<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>Subhajit Bhar</title><description>Freelance IDP Engineer — automated document pipelines for businesses. PDF extraction, OCR, invoice automation. Based in Durham, UK.</description><link>https://subhajitbhar.com/</link><item><title>AWS Textract Alternatives</title><link>https://subhajitbhar.com/blog/idp/aws-textract-alternatives/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/aws-textract-alternatives/</guid><description>AWS Textract works on standard document types and integrates cleanly into AWS infrastructure. Where it falls short: domain-specific layouts, high-volume cost, and silent extraction failures with no built-in routing to human review.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Azure Document Intelligence Alternatives</title><link>https://subhajitbhar.com/blog/idp/azure-document-intelligence-alternatives/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/azure-document-intelligence-alternatives/</guid><description>Azure Document Intelligence works well on standard document types. Here&apos;s where it falls short, and when a custom extraction pipeline is the better choice.</description><pubDate>Wed, 04 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Azure Document Intelligence vs Custom Pipeline: How to Choose</title><link>https://subhajitbhar.com/blog/idp/azure-document-intelligence-vs-custom-pipeline/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/azure-document-intelligence-vs-custom-pipeline/</guid><description>Azure Document Intelligence works well for standard document types. A custom pipeline is the better choice when edge cases matter, accuracy requirements are high, or layout variation is significant.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Certificate of Analysis Data Extraction: A Production Guide</title><link>https://subhajitbhar.com/blog/idp/certificate-of-analysis-extraction/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/certificate-of-analysis-extraction/</guid><description>Certificates of analysis are legally significant documents. Extracting data from them reliably — across multiple laboratory formats — requires more than regex or a cloud API. Here&apos;s what a production CoA extraction pipeline looks like.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Contract Data Extraction: Pulling Structured Data from Legal Documents</title><link>https://subhajitbhar.com/blog/idp/contract-data-extraction/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/contract-data-extraction/</guid><description>Contracts are the least standardised document type in most organisations. Extracting dates, parties, obligations, and clauses reliably — across varied formats — requires a different approach from invoice or form extraction.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>The Real Cost of Manual Document Processing</title><link>https://subhajitbhar.com/blog/idp/cost-of-manual-document-processing/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/cost-of-manual-document-processing/</guid><description>Manual document processing costs more than the staff hours spent on it. Errors, delays, and growth bottlenecks add up. Here&apos;s how to calculate what it&apos;s actually costing your business — and what the automation ROI looks like.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Customs Declaration Data Extraction: Automating Import and Export Documentation</title><link>https://subhajitbhar.com/blog/idp/customs-declaration-extraction/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/customs-declaration-extraction/</guid><description>Customs declarations are high-stakes, structured documents — but their extraction presents specific challenges: multilingual fields, tariff code complexity, and zero tolerance for errors. Here&apos;s what a production extraction pipeline looks like.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Docsumo Alternatives</title><link>https://subhajitbhar.com/blog/idp/docsumo-alternatives/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/docsumo-alternatives/</guid><description>Docsumo is a solid platform for financial document extraction, but its vertical focus is also its ceiling. Here&apos;s where it falls short and when an alternative makes more sense.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Building a Document Processing Pipeline with LLMs</title><link>https://subhajitbhar.com/blog/idp/document-processing-pipeline-llm-python/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/document-processing-pipeline-llm-python/</guid><description>A raw LLM call that extracts invoice data works in demos. It fails in production. The difference is the pipeline around it: schema-first design, rules baseline, confidence scoring, and human review. Here&apos;s what that looks like.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Confidence Scoring in Document Extraction: What It Is and Why It Matters</title><link>https://subhajitbhar.com/blog/idp/glossary/confidence-scoring-document-extraction/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/confidence-scoring-document-extraction/</guid><description>Confidence scoring assigns a reliability score to each extracted field in a document pipeline. It&apos;s how production IDP systems distinguish trustworthy extractions from ones that need human review.</description><pubDate>Sun, 08 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is Document Automation?</title><link>https://subhajitbhar.com/blog/idp/glossary/document-automation/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/document-automation/</guid><description>Document automation is the use of software to replace manual document handling — either generating documents from data, or extracting data from incoming documents. The second category is harder and more valuable for most businesses.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is Document Classification in IDP?</title><link>https://subhajitbhar.com/blog/idp/glossary/document-classification/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/document-classification/</guid><description>Document classification is the step that identifies what type of document has arrived before extraction begins. In pipelines that handle multiple document types, it&apos;s what routes each document to the right extraction logic.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is a Document Extraction Pipeline?</title><link>https://subhajitbhar.com/blog/idp/glossary/document-extraction-pipeline/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/document-extraction-pipeline/</guid><description>A document extraction pipeline is the end-to-end system that takes documents in and produces structured data out. This is what separates a one-off extraction script from something that runs reliably in production.</description><pubDate>Sun, 08 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is Document Validation in Extraction Pipelines?</title><link>https://subhajitbhar.com/blog/idp/glossary/document-validation/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/document-validation/</guid><description>Document validation is the step that checks whether extracted data is correct before it passes downstream. Without it, extraction errors propagate silently into your databases, reports, and compliance records.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Human-in-the-Loop Document Processing: What It Is and How to Design It</title><link>https://subhajitbhar.com/blog/idp/glossary/human-in-the-loop-document-processing/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/human-in-the-loop-document-processing/</guid><description>Human-in-the-loop (HITL) in document processing means routing uncertain extractions to a human reviewer before they pass downstream. It&apos;s not a fallback — it&apos;s an explicit design decision that makes automated extraction trustworthy.</description><pubDate>Sun, 08 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is Layout Variation in Document Extraction?</title><link>https://subhajitbhar.com/blog/idp/glossary/layout-variation/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/layout-variation/</guid><description>Layout variation is when the same document type arrives in different formats from different sources — or from the same source at different times. It&apos;s the primary reason document extraction scripts break in production.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is OCR Post-Processing?</title><link>https://subhajitbhar.com/blog/idp/glossary/ocr-post-processing/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/ocr-post-processing/</guid><description>OCR converts images to text, but raw OCR output contains errors — misread characters, broken words, formatting noise. OCR post-processing cleans and corrects this output before extraction logic runs against it.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Schema-First Extraction: What It Is and Why It Matters for Production IDP</title><link>https://subhajitbhar.com/blog/idp/glossary/schema-first-extraction/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/schema-first-extraction/</guid><description>Schema-first extraction means defining exactly what you want to extract before you touch a single document. It&apos;s the design principle that separates reliable production pipelines from scripts that break on edge cases.</description><pubDate>Sun, 08 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is Straight-Through Processing (STP)?</title><link>https://subhajitbhar.com/blog/idp/glossary/straight-through-processing/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/straight-through-processing/</guid><description>Straight-through processing is the automated handling of a document or transaction from start to finish without manual intervention. In IDP, it&apos;s the goal — but only for extractions the system is confident about.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Structured vs Unstructured Documents: What&apos;s the Difference?</title><link>https://subhajitbhar.com/blog/idp/glossary/structured-vs-unstructured-documents/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/structured-vs-unstructured-documents/</guid><description>Structured documents have predictable, machine-readable layouts. Unstructured documents present information in free-form natural language. The distinction determines how you approach extraction — and how hard the problem is.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is Table Extraction from PDFs?</title><link>https://subhajitbhar.com/blog/idp/glossary/table-extraction-pdf/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/table-extraction-pdf/</guid><description>Table extraction from PDFs is the process of identifying tabular structures in a document and converting them into structured data. It&apos;s one of the most technically demanding extraction problems because PDF tables have no single standard format.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is OCR (Optical Character Recognition)?</title><link>https://subhajitbhar.com/blog/idp/glossary/what-is-ocr/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/glossary/what-is-ocr/</guid><description>OCR converts images of text into machine-readable characters. It&apos;s the first step in processing scanned documents — but it&apos;s not the same as extracting structured data from them.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Google Document AI Alternatives</title><link>https://subhajitbhar.com/blog/idp/google-document-ai-alternatives/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/google-document-ai-alternatives/</guid><description>Google Document AI handles standard document types well, but GCP lock-in, per-page pricing, and limited control over failures make it the wrong fit for many production pipelines. Here&apos;s what to consider instead.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>How to Choose an IDP Solution: Build, Buy, or Commission</title><link>https://subhajitbhar.com/blog/idp/how-to-choose-idp-solution/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/how-to-choose-idp-solution/</guid><description>Three paths to document automation: SaaS IDP platforms, cloud provider APIs, or a custom-built pipeline. Each fits different document types, volumes, and accuracy requirements. Here&apos;s how to decide.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Intelligent Document Processing for Environmental and Water Consultancies</title><link>https://subhajitbhar.com/blog/idp/intelligent-document-processing-environmental-consultancies/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/intelligent-document-processing-environmental-consultancies/</guid><description>Environmental and water consultancies process hundreds of lab reports, monitoring results, and compliance documents every month. Most of that data entry is still manual. Here&apos;s what IDP looks like in this context — and what it actually takes to make it reliable.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Intelligent Document Processing for Legal Document Processing</title><link>https://subhajitbhar.com/blog/idp/intelligent-document-processing-legal/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/intelligent-document-processing-legal/</guid><description>Legal teams spend significant time extracting data from contracts, NDAs, and filings manually. IDP handles the extraction — but only if it&apos;s built to fail loudly, not silently. Here&apos;s what that looks like in practice.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Intelligent Document Processing for Logistics and Customs</title><link>https://subhajitbhar.com/blog/idp/intelligent-document-processing-logistics/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/intelligent-document-processing-logistics/</guid><description>Logistics and customs operations run on documents. Bills of lading, customs declarations, commercial invoices, certificates of origin — each one processed manually is a delay and a risk. Here&apos;s how IDP handles them.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Invoice Data Extraction with Python: From Script to Production Pipeline</title><link>https://subhajitbhar.com/blog/idp/invoice-data-extraction-python/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/invoice-data-extraction-python/</guid><description>Extracting data from one invoice format with Python is straightforward. Handling 20 different supplier formats reliably in production is a different problem. Here&apos;s what the production approach looks like.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Lab Report Data Extraction with Python</title><link>https://subhajitbhar.com/blog/idp/lab-report-data-extraction-python/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/lab-report-data-extraction-python/</guid><description>Lab reports from different testing laboratories look completely different. The same test results appear in different table structures, different units, different column names. Here&apos;s what reliable extraction looks like across multiple lab formats.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Nanonets Alternatives</title><link>https://subhajitbhar.com/blog/idp/nanonets-alternatives/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/nanonets-alternatives/</guid><description>Nanonets works well for AP automation on standard document types. When your documents are domain-specific, your volume is high, or you need to understand why extractions fail, you need something else.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>OCR vs Intelligent Document Processing: What&apos;s the Difference?</title><link>https://subhajitbhar.com/blog/idp/ocr-vs-intelligent-document-processing/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/ocr-vs-intelligent-document-processing/</guid><description>OCR converts images to text. IDP extracts structured data from documents. They&apos;re related but not interchangeable — and confusing them leads to building the wrong solution.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Purchase Order Data Extraction: From Manual Entry to Production Pipeline</title><link>https://subhajitbhar.com/blog/idp/purchase-order-extraction/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/purchase-order-extraction/</guid><description>Purchase order extraction looks simple until you&apos;re handling POs from dozens of customers with different formats, ERP systems, and approval workflows. Here&apos;s how a production PO extraction pipeline is structured.</description><pubDate>Thu, 12 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is Document Automation?</title><link>https://subhajitbhar.com/blog/idp/what-is-document-automation/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/what-is-document-automation/</guid><description>Document automation is the practice of replacing manual document handling with software. It covers a wide range of use cases — from generating documents automatically to extracting data from incoming ones. Here&apos;s how to think about it.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>What is Intelligent Document Processing?</title><link>https://subhajitbhar.com/blog/idp/what-is-intelligent-document-processing/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/what-is-intelligent-document-processing/</guid><description>A plain-English guide to IDP: what it is, how it works, when you need it, and how to evaluate your options — from OCR and rules-based extraction to LLM-augmented pipelines.</description><pubDate>Wed, 04 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Why Your Document Automation Keeps Breaking on Edge Cases</title><link>https://subhajitbhar.com/blog/idp/why-document-automation-breaks-on-edge-cases/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/idp/why-document-automation-breaks-on-edge-cases/</guid><description>Simple scripts, enterprise platforms, and LLM-only extraction all break the same way: clean documents work, real ones don&apos;t. Here&apos;s why, and what production pipelines do differently.</description><pubDate>Wed, 04 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Extract Data from Scanned PDFs with Python</title><link>https://subhajitbhar.com/blog/pdf-extraction/extract-data-scanned-pdf-python/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/pdf-extraction/extract-data-scanned-pdf-python/</guid><description>Scanned PDFs contain images, not text. pdfplumber returns nothing. You need an OCR layer first, then extraction logic on top. Here&apos;s the full pipeline.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Extracting Tables from PDFs in Python: The Complete Guide</title><link>https://subhajitbhar.com/blog/pdf-extraction/extract-tables-from-pdf-python/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/pdf-extraction/extract-tables-from-pdf-python/</guid><description>Table extraction from PDFs in Python using pdfplumber — bordered and borderless tables, multi-page tables, post-processing, and the edge cases that break naive approaches.</description><pubDate>Wed, 04 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Handling PDF Layout Variations in Python</title><link>https://subhajitbhar.com/blog/pdf-extraction/handle-pdf-layout-variations-python/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/pdf-extraction/handle-pdf-layout-variations-python/</guid><description>An extraction script that works on one supplier&apos;s invoice breaks on another&apos;s. The same document type, different layout. Here&apos;s how to build extraction logic that handles multiple formats without a separate script for each.</description><pubDate>Wed, 11 Mar 2026 00:00:00 GMT</pubDate></item><item><title>pdfplumber vs PyMuPDF vs PyPDF2 for PDF Extraction</title><link>https://subhajitbhar.com/blog/pdf-extraction/pdfplumber-vs-pymupdf-vs-pypdf2/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/pdf-extraction/pdfplumber-vs-pymupdf-vs-pypdf2/</guid><description>A practical comparison of pdfplumber, PyMuPDF (fitz), and PyPDF2 — with code examples and a decision framework for production use.</description><pubDate>Wed, 04 Mar 2026 00:00:00 GMT</pubDate></item><item><title>Schema-First PDF Extraction in Python with Pydantic</title><link>https://subhajitbhar.com/blog/pdf-extraction/schema-first-pdf-extraction-pydantic/</link><guid isPermaLink="true">https://subhajitbhar.com/blog/pdf-extraction/schema-first-pdf-extraction-pydantic/</guid><description>Define your output schema before writing extraction logic. Schema-first PDF extraction with Pydantic — the approach that keeps production pipelines maintainable.</description><pubDate>Wed, 04 Mar 2026 00:00:00 GMT</pubDate></item></channel></rss>