db.py 3.2 KB

1234567891011121314151617181920212223242526272829303132333435363738394041424344454647484950515253545556575859606162636465666768697071727374757677787980818283848586878889909192939495969798
  1. from pymongo import MongoClient,errors
  2. from bson.objectid import ObjectId
  3. import datetime
  4. import re
  5. class db():
  6. DB="alexis"
  7. def __init__(self):
  8. self.client = MongoClient('localhost', 27017)
  9. self.c_sources=self.client[self.DB]["sources"]
  10. self.c_articles=self.client[self.DB]["articles"]
  11. def jsonable(self, el):
  12. if el is None or "_id" not in el:
  13. return el
  14. el["_id"]=str(el["_id"])
  15. return el
  16. def filter_articles(self, filter, limit=80):
  17. db_filter={}
  18. db_filter["matches"]=True
  19. db_filter["scrap_date"]={}
  20. if "maxdate" in filter and len(filter["maxdate"])>7:
  21. db_filter["scrap_date"]["$lt"]=datetime.datetime.strptime(filter["maxdate"],"%Y-%m-%d")
  22. if "mindate" in filter and len(filter["mindate"])>7:
  23. db_filter["scrap_date"]["$gt"]=datetime.datetime.strptime(filter["mindate"],"%Y-%m-%d")
  24. if db_filter["scrap_date"]=={}:
  25. del db_filter["scrap_date"]
  26. if "minweight" in filter and filter != "":
  27. db_filter["weight"]={"$gt":int(filter["minweight"])}
  28. if "keyword" in filter and len(filter["keyword"]) >0:
  29. db_filter["kw"]={"$all": filter["keyword"]}
  30. print(db_filter)
  31. #{'site': 'site', 'mindate': 'mind', 'maxddate': 'maxd', 'minweight': 'minwe'}
  32. return [ self.jsonable(p) for p in self.c_articles.find(db_filter,{"html":0,"text":0}).limit(limit) ]
  33. def articles(self, id=None, limit=100):
  34. if id is None:
  35. return [ self.jsonable(p) for p in self.c_articles.find({"matches":True},{"html":0,"text":0}).limit(limit) ]
  36. ret=self.c_articles.find_one({"_id":ObjectId(id)})
  37. return self.jsonable(ret)
  38. def sources(self,id=None):
  39. if id is None:
  40. return [ self.jsonable(p) for p in self.c_sources.find() ]
  41. ret=self.c_sources.find_one({"_id":ObjectId(id)})
  42. return self.jsonable(ret)
  43. def rss_sources(self):
  44. return [ p for p in self.c_sources.find({"rss":1}) ]
  45. def insert_article(self,o):
  46. try:
  47. self.c_articles.insert_one(o)
  48. return True
  49. except errors.DuplicateKeyError:
  50. print("Dup")
  51. return False
  52. def purge_error(self):
  53. self.c_articles.remove({'error':True})
  54. def article_exists(self,url):
  55. ret=self.c_articles.find_one({'url':url})
  56. if ret is None:
  57. return False
  58. return True
  59. def lower_arr(self,arr):
  60. return [a.lower() for a in arr]
  61. def get_keywords_list(self):
  62. kw=self.client[self.DB]["keywords"]
  63. return [ k["keyword"] for k in kw.find({}) ]
  64. def get_keywords(self,category):
  65. kw=self.client[self.DB]["keywords"] #FIXME, split on "|" or regex
  66. ret = [ {"weight":k["weight"],
  67. "kw": k["keyword"],
  68. "pattern": self.lower_arr(k["keyword"].split("|")) } for k in kw.find({}) ]#FIXME, categories
  69. return ret
  70. def add_source(self,url,rss,selector,name):
  71. self.c_sources.insert({"link":url,
  72. "rss":rss,
  73. "selector":selector,
  74. "name":name,
  75. "category":0})