
Paperless-ngx: التحول إلى مكتب بلا أوراق بأرشفة المستندات والتعلم الآلي المحلي
الرقمنة السيادية: محاربة الفوضى الورقية بأرشفة ذكية ونظام OCR محلي
يتراكم في كل منزل ومكتب جبل من المستندات الورقية: فواتير الشراء، وعقود الإيجار، والتقارير الطبية، والوثائق الضريبية، مما يجعل العثور على ورقة معينة بعد أشهر مهمة بحثية معقدة ومحبطة. يقدم مشروع Paperless-ngx الحل الجذري الأقوى لهذه المشكلة، محولاً الماسح الضوئي أو كاميرا هاتفك إلى بوابة ذكية لأرشفة مكتبتك الرقمية بالكامل والبحث في نصوصها في أجزاء من الثانية.
يتميز Paperless-ngx بمحرك معالجة متكامل يسحب المستندات تلقائيًا عبر البريد الإلكتروني أو المجلدات المشتركة، ويجري عليها فحصًا ضوئيًا (OCR) لاستخراج النصوص، ثم يستخدم نماذج تعلم آلي لتخمين المراسل، وتاريخ الوثيقة، وفئتها، مع حفظ نسخة معيارية بصيغة PDF/A قابلة للبقاء لعقود طويلة.
ما هو Paperless-ngx؟
Paperless-ngx هو نظام إدارة وثائق وأرشفة إلكترونية رقمي مفتوح المصدر بالكامل (GPL-3.0). يعمل كخادم محلي مزود بواجهة ويب عصرية سريعة تدعم البحث بالنص الكامل (Full-Text Search)، وتصفية المستندات بحسب التواريخ والوسوم والمراسلين، وتصدير الأرشيف بمسارات ملفات منظمة وواضحة على القرص الصلب.
يدعم النظام ميزات استثنائية تشمل: قراءة الباركودات وفصل المستندات المجمعة تلقائيًا، ومطابقة النصوص باللغات المتعددة بما فيها العربية والإنجليزية، وتشفير البيانات، والعمل التلقائي التام دون الحاجة لأي تدخل يدوي بمجرد إلقاء الملف في مجلد السحب.
لماذا لم تسمع به من قبل؟
نشأ المشروع كإعادة إحياء وتطوير جذري لمشروعي Paperless و Paperless-ng القديمين. وبفضل تكاتف مجتمع المطورين وإضافة خوارزميات الذكاء الاصطناعي لتصنيف المستندات، تحول Paperless-ngx إلى ركيزة لا غنى عنها في عالم الاستضافة الذاتية، محققًا ثورة حقيقية في مفهوم “الحياة بلا أوراق” (Paperless Living).
كيف يعمل تحت الغطاء؟
تتألف البنية البرمجية لـ Paperless-ngx من سلسلة معالجة غير متزامنة:
- محرك الاستيعاب (Document Ingestion): يراقب مجلد
consumeالمخصص، أو يسحب المرفقات دوريًا من حسابات البريد الإلكتروني عبر بروتوكول IMAP. - محرك الاستخراج البصري (Tesseract OCR & Ghostscript): يحلل ملفات الصور و PDF، ويستخرج كافة الكلمات بدقة، ويولد طبقة نصية مدمجة قابلة للتحديد والنسخ.
- مصنف التعلم الآلي الداخلي (Scikit-Learn Classifier): يتدرب تدريجيًا على مستنداتك السابقة ليتعلم تلقائيًا كيفية تعيين الوسوم وتحديد نوع الوثيقة والجهة المصدرة بناءً على النصوص المكتشفة.
- محرك البحث المفهرس (Tantivy / Whoosh): يفهرس كل كلمة في مستنداتك ليتيح البحث الفوري المطابق للعبارات بدقة تشبه محرك جوجل الداخلي.
دليل التثبيت والتشغيل عبر Docker Compose
يتم تشغيل Paperless-ngx مع قواعد بيانات PostgreSQL و Redis لضمان الأداء الفائق. أنشئ ملف docker-compose.yml التالي:
services:
broker:
image: docker.io/library/redis:7-alpine
container_name: paperless-redis
restart: unless-stopped
volumes:
- ./redis_data:/data
db:
image: docker.io/library/postgres:16-alpine
container_name: paperless-db
restart: unless-stopped
environment:
POSTGRES_DB: paperless
POSTGRES_USER: paperless
POSTGRES_PASSWORD: secret_paperless_db_password
volumes:
- ./postgres_data:/var/lib/postgresql/data
webserver:
image: ghcr.io/paperless-ngx/paperless-ngx:latest
container_name: paperless-webserver
restart: unless-stopped
depends_on:
- db
- broker
ports:
- "8000:8000"
environment:
PAPERLESS_REDIS: redis://broker:6379
PAPERLESS_DBHOST: db
PAPERLESS_DBNAME: paperless
PAPERLESS_DBUSER: paperless
PAPERLESS_DBPASS: secret_paperless_db_password
PAPERLESS_SECRET_KEY: generate_a_very_long_secret_key_here
PAPERLESS_TIME_ZONE: Asia/Riyadh
PAPERLESS_OCR_LANGUAGE: ara+eng
volumes:
- ./data:/usr/src/paperless/data
- ./media:/usr/src/paperless/media
- ./export:/usr/src/paperless/export
- ./consume:/usr/src/paperless/consume
لتشغيل الخادم:
docker compose up -d
لإنشاء حساب المدير الأولي، نفّذ الأمر التالي في الطرفية:
docker compose exec webserver python3 manage.py createsuperuser
توجه بعدها إلى http://<SERVER_IP>:8000 وسجّل دخولك للبدء في رمي ملفاتك في مجلد consume ومراقبة السحر.
ما الذي يستبدله؟
- يستبدل الملفات الورقية وخزائن الأرشيف: يحول أوراقك إلى ملفات رقمية مفهرسة ومحمية من التلف والضياع.
- يستبدل برمجيات إدارة المستندات السحابية المكلفة: يوفر أرشفة غير محدودة ومشفرة محليًا دون دفع رسوم اشتراك شهرية.
- يستبدل البحث اليدوي المرهق: يتيح لك العثور على أي فاتورة صادرة منذ 5 سنوات في جزء من الثانية بمجرد كتابة اسم المنتج أو الرقم الضريبي.
الحدود والقيود التقنية
تتطلب معالجة ملفات PDF الكبيرة والكتب متعددة الصفحات عبر OCR قدرًا ملحوظًا من استهلاك المعالج (CPU) أثناء المعالجة الأولية، ولكن بمجرد اكتمال الفهرسة يعود استهلاك الموارد إلى حده الأدنى.
الفئات المستهدفة
- الأفراد والعائلات الراغبون في تنظيم وثائقهم الرسمية والفواتير والضمانات والتخلص من الفوضى الورقية.
- المكاتب الهندسية والقانونية والمحاسبية التي تتعامل مع آلاف العقود والمستندات يوميًا.
- أصحاب المعامل المنزلية الذين يمتلكون ماسحات ضوئية شبكية ويرغبون في أتمتة تدفق المستندات بالكامل.
الخلاصة
يعد Paperless-ngx قمة الإنتاجية في عالم الاستضافة الذاتية؛ فهو ليس مجرد أداة تخزين، بل هو نظام متكامل يعيد لك وقتك ويوفر عليك ساعات من البحث اليدوي الممل.