OCR-to-RAG pipeline for life science screenshots
PaddleOCR with preprocessing, scispaCy NER, figure/table detection, citation extraction, and chunked Markdown output with frontmatter. Includes watch mode and notebook reprocessing.
This commit is contained in:
12
src/ocr_pipeline/__init__.py
Normal file
12
src/ocr_pipeline/__init__.py
Normal file
@@ -0,0 +1,12 @@
|
||||
from __future__ import annotations
|
||||
|
||||
__version__ = "0.1.0"
|
||||
|
||||
from .cli import main
|
||||
from .pipeline import OCRPipeline, PipelineResult
|
||||
|
||||
__all__ = [
|
||||
"OCRPipeline",
|
||||
"PipelineResult",
|
||||
"main",
|
||||
]
|
||||
Reference in New Issue
Block a user