hasadna / hasadna/standalone-tasks
זיהוי צמדים בהודעות פטור
- Dominant language
- No language data
- Stars
- 11
- Forks
- 2
- PR merge metrics
- No merged PRs in 30d
Description
## מבוא
יש לנו בסיס נתונים של "הודעות פטור ממכרז" של משרדי ממשלה, המפרט התקשרויות עם גופים חיצוניים בפטור ממכרז. הוא כולל הסבירים מדוע באותם מקרים אין צורך לצאת למכרז, מי הגוף שמתקשרים איתו ובאיזה סכום. אנחנו שואבים את המידע מתוך [אתר מינהל הרכש הממשלתי](http://www.mr.gov.il/ExemptionMessage/Pages/SearchExemptionMessages.aspx). בסיס הנתונים הזה נמצא [ברידאש](data.obudget.org) ונקרא
exemption.
## הבעיה
בהודעות פטור מסוג: ספק יחיד, התקשרות עם ספק חוץ, והתקשרות למיזם משותף ללא כוונת רווח, ההתקשרות מדווחת בשתי רשומות נפרדות:
ברשומה המוקדמת יותר - מדווחים על כוונת ההתקשרות (ואז נותנים לציבור זמן להגיש השגות). ברשומה הזאת סכום ההתקשרות יהיה 0 (כי ההתקשרות עדיין לא אושרה), והסטאטוס יהיה "טרום החלטת וועדה".
ברשומה המאוחרת יותר - מדווחים על כך שההתקשרות אושרה, ואז גם יהיה כתוב סכום ההתקשרות. הסטאטוס יהיה "נרשם".
[לדוגמא](http://www.obudget.org/#entity/511380693/publication/579763)
כרגע, אין לנו סימון לכך שמדובר בצמדי רשומות. ככה זה נראה באתר שלנו:

יש כמה דרכים לזהות שמדובר בצמד:
- אותו מפרסם (משרד ממשלתי).
- שם הספק ומספר הספק זהה.
- אותו נושא, או דומה מאד (לעיתים משנים קצת את התיאור של ההתקשרות).
- אותם תיוגים של נושאים.
- תאריך תחילת ההתקשרות ותאריך סיום ההתקשרות זהה או דומה מאד (לעיתים משתנה בכמה ימים).
- חלק מהמסמכים הם זהים (מאותו תאריך ואותו מסמך).
## המשימה
לכתוב אלגוריתם שמאפשר לזהות כמה שיותר צמדי רשומות, כדי שנוכל להציג אותם ביחד
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.