improve the OCR pipeline processing and outputs formatting

This commit is contained in:
2026-07-19 19:54:53 +02:00
parent d375db47c3
commit 1cf1c6eeab
30 changed files with 3838 additions and 3900 deletions

View File

@@ -2,7 +2,7 @@ from __future__ import annotations
from .chunk import SemanticChunker, TextChunk, chunk_text
from .clean import CleanResult, clean_text
from .entities import Entity, SciSpacyNER, extract_entities, summarize_entities
from .entities import Entity, ScientificEntityRecognizer, extract_entities, summarize_entities
__all__ = [
"clean_text",
@@ -13,5 +13,5 @@ __all__ = [
"extract_entities",
"summarize_entities",
"Entity",
"SciSpacyNER",
"ScientificEntityRecognizer",
]