STACKDUST
EN
رسم توضيحي تحريري لنظام أرشفة وإدارة مستندات ورقية رقمي Paperless-ngx يعتمد التعرف الضوئي OCR والتعلم الآلي بأسلوب STACKDUST الداكن

Paperless-ngx: التحول إلى مكتب بلا أوراق بأرشفة المستندات والتعلم الآلي المحلي


الرقمنة السيادية: محاربة الفوضى الورقية بأرشفة ذكية ونظام OCR محلي

يتراكم في كل منزل ومكتب جبل من المستندات الورقية: فواتير الشراء، وعقود الإيجار، والتقارير الطبية، والوثائق الضريبية، مما يجعل العثور على ورقة معينة بعد أشهر مهمة بحثية معقدة ومحبطة. يقدم مشروع Paperless-ngx الحل الجذري الأقوى لهذه المشكلة، محولاً الماسح الضوئي أو كاميرا هاتفك إلى بوابة ذكية لأرشفة مكتبتك الرقمية بالكامل والبحث في نصوصها في أجزاء من الثانية.

يتميز Paperless-ngx بمحرك معالجة متكامل يسحب المستندات تلقائيًا عبر البريد الإلكتروني أو المجلدات المشتركة، ويجري عليها فحصًا ضوئيًا (OCR) لاستخراج النصوص، ثم يستخدم نماذج تعلم آلي لتخمين المراسل، وتاريخ الوثيقة، وفئتها، مع حفظ نسخة معيارية بصيغة PDF/A قابلة للبقاء لعقود طويلة.

ما هو Paperless-ngx؟

Paperless-ngx هو نظام إدارة وثائق وأرشفة إلكترونية رقمي مفتوح المصدر بالكامل (GPL-3.0). يعمل كخادم محلي مزود بواجهة ويب عصرية سريعة تدعم البحث بالنص الكامل (Full-Text Search)، وتصفية المستندات بحسب التواريخ والوسوم والمراسلين، وتصدير الأرشيف بمسارات ملفات منظمة وواضحة على القرص الصلب.

يدعم النظام ميزات استثنائية تشمل: قراءة الباركودات وفصل المستندات المجمعة تلقائيًا، ومطابقة النصوص باللغات المتعددة بما فيها العربية والإنجليزية، وتشفير البيانات، والعمل التلقائي التام دون الحاجة لأي تدخل يدوي بمجرد إلقاء الملف في مجلد السحب.

لماذا لم تسمع به من قبل؟

نشأ المشروع كإعادة إحياء وتطوير جذري لمشروعي Paperless و Paperless-ng القديمين. وبفضل تكاتف مجتمع المطورين وإضافة خوارزميات الذكاء الاصطناعي لتصنيف المستندات، تحول Paperless-ngx إلى ركيزة لا غنى عنها في عالم الاستضافة الذاتية، محققًا ثورة حقيقية في مفهوم “الحياة بلا أوراق” (Paperless Living).

كيف يعمل تحت الغطاء؟

تتألف البنية البرمجية لـ Paperless-ngx من سلسلة معالجة غير متزامنة:

  1. محرك الاستيعاب (Document Ingestion): يراقب مجلد consume المخصص، أو يسحب المرفقات دوريًا من حسابات البريد الإلكتروني عبر بروتوكول IMAP.
  2. محرك الاستخراج البصري (Tesseract OCR & Ghostscript): يحلل ملفات الصور و PDF، ويستخرج كافة الكلمات بدقة، ويولد طبقة نصية مدمجة قابلة للتحديد والنسخ.
  3. مصنف التعلم الآلي الداخلي (Scikit-Learn Classifier): يتدرب تدريجيًا على مستنداتك السابقة ليتعلم تلقائيًا كيفية تعيين الوسوم وتحديد نوع الوثيقة والجهة المصدرة بناءً على النصوص المكتشفة.
  4. محرك البحث المفهرس (Tantivy / Whoosh): يفهرس كل كلمة في مستنداتك ليتيح البحث الفوري المطابق للعبارات بدقة تشبه محرك جوجل الداخلي.

دليل التثبيت والتشغيل عبر Docker Compose

يتم تشغيل Paperless-ngx مع قواعد بيانات PostgreSQL و Redis لضمان الأداء الفائق. أنشئ ملف docker-compose.yml التالي:

services:
  broker:
    image: docker.io/library/redis:7-alpine
    container_name: paperless-redis
    restart: unless-stopped
    volumes:
      - ./redis_data:/data

  db:
    image: docker.io/library/postgres:16-alpine
    container_name: paperless-db
    restart: unless-stopped
    environment:
      POSTGRES_DB: paperless
      POSTGRES_USER: paperless
      POSTGRES_PASSWORD: secret_paperless_db_password
    volumes:
      - ./postgres_data:/var/lib/postgresql/data

  webserver:
    image: ghcr.io/paperless-ngx/paperless-ngx:latest
    container_name: paperless-webserver
    restart: unless-stopped
    depends_on:
      - db
      - broker
    ports:
      - "8000:8000"
    environment:
      PAPERLESS_REDIS: redis://broker:6379
      PAPERLESS_DBHOST: db
      PAPERLESS_DBNAME: paperless
      PAPERLESS_DBUSER: paperless
      PAPERLESS_DBPASS: secret_paperless_db_password
      PAPERLESS_SECRET_KEY: generate_a_very_long_secret_key_here
      PAPERLESS_TIME_ZONE: Asia/Riyadh
      PAPERLESS_OCR_LANGUAGE: ara+eng
    volumes:
      - ./data:/usr/src/paperless/data
      - ./media:/usr/src/paperless/media
      - ./export:/usr/src/paperless/export
      - ./consume:/usr/src/paperless/consume

لتشغيل الخادم:

docker compose up -d

لإنشاء حساب المدير الأولي، نفّذ الأمر التالي في الطرفية:

docker compose exec webserver python3 manage.py createsuperuser

توجه بعدها إلى http://<SERVER_IP>:8000 وسجّل دخولك للبدء في رمي ملفاتك في مجلد consume ومراقبة السحر.

ما الذي يستبدله؟

  • يستبدل الملفات الورقية وخزائن الأرشيف: يحول أوراقك إلى ملفات رقمية مفهرسة ومحمية من التلف والضياع.
  • يستبدل برمجيات إدارة المستندات السحابية المكلفة: يوفر أرشفة غير محدودة ومشفرة محليًا دون دفع رسوم اشتراك شهرية.
  • يستبدل البحث اليدوي المرهق: يتيح لك العثور على أي فاتورة صادرة منذ 5 سنوات في جزء من الثانية بمجرد كتابة اسم المنتج أو الرقم الضريبي.

الحدود والقيود التقنية

تتطلب معالجة ملفات PDF الكبيرة والكتب متعددة الصفحات عبر OCR قدرًا ملحوظًا من استهلاك المعالج (CPU) أثناء المعالجة الأولية، ولكن بمجرد اكتمال الفهرسة يعود استهلاك الموارد إلى حده الأدنى.

الفئات المستهدفة

  • الأفراد والعائلات الراغبون في تنظيم وثائقهم الرسمية والفواتير والضمانات والتخلص من الفوضى الورقية.
  • المكاتب الهندسية والقانونية والمحاسبية التي تتعامل مع آلاف العقود والمستندات يوميًا.
  • أصحاب المعامل المنزلية الذين يمتلكون ماسحات ضوئية شبكية ويرغبون في أتمتة تدفق المستندات بالكامل.

الخلاصة

يعد Paperless-ngx قمة الإنتاجية في عالم الاستضافة الذاتية؛ فهو ليس مجرد أداة تخزين، بل هو نظام متكامل يعيد لك وقتك ويوفر عليك ساعات من البحث اليدوي الممل.

المصادر


المقال التاليDockge: الدليل الشامل لإدارة حزم Docker Compose بواجهة تفاعلية لحظيةالمقال السابقUptime Kuma: الدليل الشامل لمراقبة الخوادم والخدمات وإنشاء صفحات الحالة العامة