בקשת עזרה תוכנה למיון ספרים!
-
@sivan22
יש לי כוננים מלאים בכמה עשרות אלפי ספרים רובם מהיברו בוקס,
והשמות שלהם שונו לשמות האמיתיים,
כעת אני צריך למיין הכל.....
ולכן אין לי פתרון מלבד זה.@mefateach כתב בשיתוף | שיתוף ובקשת עזרה, תוכנה למיון ספרים!:
אולי אפשר עם ocr
זה לא יהיה מדאי איטי?
-
-
@mefateach
תודה אכן אני רואה שצריך ללכת לכיוון של זיהוי אופטי,
האם מישהו יוכל להדריך אותי,
איזה ספריה צריך להוריד בשביל זיהוי כזה, [שיבדוק אם יש אות W בעמוד הראשון בכל קובץ]
וכן מה לשנות בסקריפט? -
@mefateach
כבר כתבתי ששינו כבר את השמות לשמות האמיתיים,
מדובר על 600 גיגה שאני צריך למיין. -
@sivan22 כתב בשיתוף | שיתוף ובקשת עזרה, תוכנה למיון ספרים!:
אבל אני מאמין שתוכל עם ספריה כמו PDFPY2 למצוא אם יש תיבת טקסט, כמו שהצעת, וזה יותר פשוט.
ניסיתי קרוב ל40 פעם [עם כל מיני שינויים ותיקונים כל פעם] ולא הצלחתי.
@sivan22 כתב בשיתוף | שיתוף ובקשת עזרה, תוכנה למיון ספרים!:
בשביל OCR תוכל להשתמש בtesseract
אפשר להוריד באמצעות PIP?
-
יום חדש מתחילהשיב לאלף שין לפני 9 חודשים נערך לאחרונה על ידי יום חדש מתחיל 7 במאי 2024, 14:17
@אלף-שין כתב בשיתוף | שיתוף ובקשת עזרה, תוכנה למיון ספרים!:
בשביל OCR תוכל להשתמש בtesseract
אפשר להוריד באמצעות PIP?
וודאי, רק תכתוב באותיות קטנות, ותשים לב כשאתה מעתיק לא להעתיק את ה-ב' שבתחילת המילה.
מחכים כבר מאוד להודעה הדרמטית שלך......... -
@mefateach
הלוואי. -
@אלף-שין כתב בשיתוף | שיתוף ובקשת עזרה, תוכנה למיון ספרים!:
ניסיתי קרוב ל40 פעם [עם כל מיני שינויים ותיקונים כל פעם] ולא הצלחתי.
אני מאמין שהוא התכוין לזה:
pip install PyPDF2
-
אלף שיןהשיב ליום חדש מתחיל לפני 9 חודשים נערך לאחרונה על ידי אלף שין 7 ביוני 2024, 18:24
@יום-חדש-מתחיל
הספריה הזאת PyPDF2 לא מזהה,
בדקתי בעשרות הגדרות שניסיתי. -
@mefateach כתב בשיתוף | שיתוף ובקשת עזרה, תוכנה למיון ספרים!:
@אלף-שין תגגל על tensorflow
לא, זה מדאי כבד לי,
אני צריך בסך הכל שיהיה חע סקריפט שעובד על קבצי הPDF
שהשקריפט לא זיהה בהם בעמוד הראשון את התו W,
במקרה כזה הסקריפט יעשה OCR לעמוד הראשון בלבד,
ואז יחפש אם יש את התו W. -
פוסט זה נמחק!
-
יום חדש מתחילהשיב לאלף שין לפני 9 חודשים נערך לאחרונה על ידי יום חדש מתחיל 7 ביוני 2024, 19:49
@אלף-שין כתב בשיתוף | שיתוף ובקשת עזרה, תוכנה למיון ספרים!:
הספריה הזאת PyPDF2 לא מזהה
https://pypi.org/project/PyPDF2/
pip install PyPDF2
עריכה: עכשיו אני רואה שהסקריפט שכתבת למעלה גם משתמש בספרי' הזו...
-
from pypdf import PdfReader def is_hebrew_books(file): reader = PdfReader(file) annotations = reader.pages[0].annotations for annotation in annotations: if annotation.get("/Subtype") == "/Link" and annotation.get("/A").get("/URI") == "http://www.hebrewbooks.org": return True return False נ.ב. בדקתי רק על שני קבצים
11/38