{"id":357585,"date":"2015-12-20T23:10:24","date_gmt":"2015-12-20T22:10:24","guid":{"rendered":"http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/?p=357585"},"modified":"2015-12-20T23:05:36","modified_gmt":"2015-12-20T22:05:36","slug":"howto-web-scraping-niet-alleen-voor-growth-hackers","status":"publish","type":"post","link":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/howto-web-scraping-niet-alleen-voor-growth-hackers\/","title":{"rendered":"[HowTo] Web scraping; niet alleen voor growth hackers"},"content":{"rendered":"<p><img loading=\"lazy\" decoding=\"async\" class=\"size-medium wp-image-357686 aligncenter\" src=\"http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/WebScraper_PatricVanMaaren-700x366.png\" alt=\"How to &quot;Web scraping&quot; door Patric van Maaren\" width=\"700\" height=\"366\" title=\"\" srcset=\"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/WebScraper_PatricVanMaaren-700x366.png 700w, https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/WebScraper_PatricVanMaaren-300x157.png 300w, https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/WebScraper_PatricVanMaaren-520x272.png 520w, https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/WebScraper_PatricVanMaaren-250x131.png 250w, https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/WebScraper_PatricVanMaaren-768x402.png 768w, https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/WebScraper_PatricVanMaaren-1024x536.png 1024w, https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/WebScraper_PatricVanMaaren.png 1200w\" sizes=\"auto, (max-width: 700px) 100vw, 700px\" \/><\/p>\n<p>Web scraping is hot en niet alleen voor startups of growth hackers. Handige\u00a0(online)\u00a0marketeers\u00a0gebruiken het om sites\u00a0te\u00a0analyseren, marktonderzoek te doen of leads\u00a0te verzamelen.<\/p>\n<h2>Wat is web scraping?<\/h2>\n<p>Web scraping is de extractie van informatie uit websites of applicaties van derden. Met speciale scripts of tools wordt ongestructureerde data van een website omgezet naar een gestructureerde opslag. Dit gebeurt in de vorm van een bestand\u00a0of database. Sommige tools kunnen ook\u00a0API&#8217;s maken, zodat je de data\u00a0uit de bron ook in andere applicaties kunt opvragen.<\/p>\n<h2>Welke toepassingen zijn er?<\/h2>\n<p>Een opvallend voorbeeld is de\u00a0lead generation van een amerikaanse makelaarsfirma: zij <em>scrapen<\/em>\u00a0de overlijdensberichten van online kranten om daarna de familie te benaderen en hulp te bieden bij de verkoop van het huis.<\/p>\n<p>Marketing teams bij grote bedrijven\u00a0maken\u00a0ook al veel gebruik van web scraping technieken.\u00a0Denk hierbij aan:<\/p>\n<ul>\n<li>Prijsvergelijking.<\/li>\n<li>Ranking zoekresultaten.<\/li>\n<li>Contactlijsten leads\/influencers.<\/li>\n<li>Klantreviews op sites van derden.<\/li>\n<li>Wijzigingen catalogus of product details concurrent.<\/li>\n<li>Analyse van engagement op blogposts.<\/li>\n<\/ul>\n<h2>Mag het eigenlijk wel?<\/h2>\n<p>De discussie wordt\u00a0sinds lange tijd gevoerd,\u00a0een bekend voorbeeld is de vete tussen Funda en Jaap.nl. Vaak\u00a0is het kopi\u00ebren\u00a0van informatie een inbreuk op auteurs- en\/of databankrecht.<\/p>\n<p>Gebruik je de data\u00a0als input voor research waarmee je\u00a0nieuwe\u00a0informatie produceert, mag het vaak wel. Maar dat\u00a0hangt ook af van de gebruiksvoorwaarden van de website. Kortom een grijs gebied waar je bij twijfel een gespecialiseerde jurist bij moet\u00a0raadplegen.<\/p>\n<h2>Hoe pas je dit op Social Media toe?<\/h2>\n<p>Platformen, zoals Facebook, Twitter of LinkedIn, hebben\u00a0een eigen API waarmee je data kunt uitlezen. Vooral\u00a0bij blogs,\u00a0fora en community websites die dat niet hebben kan\u00a0web scraping een uitkomst zijn.<\/p>\n<p>Wil je weten welke content het meest gelezen wordt, welke bezoeker\u00a0de meeste comments\u00a0schrijft, of wil je een lijst van populaire vloggers op YouTube? Dat kan eenvoudig,\u00a0als je gebruikt maakt van de juiste tool.<\/p>\n<h2>Welke tools zijn er?<\/h2>\n<p>Vroeger\u00a0moest je veel zelf programmeren, maar met deze\u00a0nieuwe\u00a0tools is het eenvoudiger geworden. Ik noem er een paar die gratis te gebruiken of te proberen zijn:<\/p>\n<ul>\n<li><a href=\"http:\/\/bit.ly\/wbscrpr\" target=\"_blank\" rel=\"noopener\">Webscraper.io<\/a><\/li>\n<li><a href=\"http:\/\/bit.ly\/uipath\" target=\"_blank\" rel=\"noopener\">UiPath<\/a>\u00a0(trial)<\/li>\n<li><a href=\"http:\/\/bit.ly\/kmono\" target=\"_blank\" rel=\"noopener\">Kimono<\/a><\/li>\n<li><a href=\"http:\/\/bit.ly\/mozenda\" target=\"_blank\" rel=\"noopener\">Mozenda<\/a>\u00a0(trial)<\/li>\n<li><a href=\"http:\/\/bit.ly\/cldscrp\" target=\"_blank\" rel=\"noopener\">Cloudscrape<\/a>\u00a0(trial)<\/li>\n<li><a href=\"http:\/\/bit.ly\/imprtio\" target=\"_blank\" rel=\"noopener\">Import.io<\/a><\/li>\n<\/ul>\n<p>&nbsp;<\/p>\n<h2>How To: Web scraping\u00a0met Import.io<\/h2>\n<p>Om eenvoudig te beginnen heb ik in een aantal stappen een extractie gemaakt van de artikelen op\u00a0nieuws.marketing.<\/p>\n<p>1. Maak een account aan op Import.io,\u00a0installeer\u00a0en open de desktop applicatie.<\/p>\n<p>2. Klik op <strong>New<\/strong><\/p>\n<p>3. Kies <strong>Start Magic<\/strong><\/p>\n<p>4. Voer de URL in van de webpagina die je wilt scrapen, <a href=\"http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/\" target=\"_blank\" rel=\"noopener\">http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/<\/a><\/p>\n<p>5. Klik op <strong>Extract Data<\/strong><\/p>\n<p>Je krijgt nu een overzicht van alle data gestructureerd in kolommen. In deze kolommen vind je bijvoorbeeld de titel van het artikel, het aantal views en de auteur.<\/p>\n<p>&nbsp;<\/p>\n<p><img loading=\"lazy\" decoding=\"async\" src=\"http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/webscraping_1-700x379.png\" alt=\"webscraping_1\" width=\"700\" height=\"379\" title=\"\"><\/p>\n<p>&nbsp;<\/p>\n<p>6. Klik op <strong>Save API<\/strong>\u00a0om de definitie van de extractie op te slaan en opnieuw te gebruiken<\/p>\n<p>7. In het\u00a0volgende scherm\u00a0selecteer je bij &#8220;<em>How would you like to use the API?<\/em>&#8221; de optie\u00a0<strong>Bulk Extract<\/strong><\/p>\n<p>8. Open een spreadsheet en maak even snel een samenvoeging van het hoofdbestanddeel van de url van overzichtspagina (<a href=\"http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/page\/\" target=\"_blank\" rel=\"noopener\">http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/page\/<\/a>) en de nummers 2 tot en met &#8230;\u00a0(de laatste overzichtspagina)<\/p>\n<p>&nbsp;<\/p>\n<p><img loading=\"lazy\" decoding=\"async\" src=\"http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/webscraping_2-700x382.png\" alt=\"Google Sheets\" width=\"700\" height=\"382\" title=\"\"><\/p>\n<p>&nbsp;<\/p>\n<p>9. Knip en plak de eerste webpagina\u00a0<a href=\"http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/\" target=\"_blank\" rel=\"noopener\">http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/<\/a>\u00a0en de gehele lijst uit de spreadsheet voor overzichtpaginas 2 t\/m \u2026 in het veld voor extractie<\/p>\n<p>&nbsp;<\/p>\n<p><img loading=\"lazy\" decoding=\"async\" src=\"http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/webscraping_3-700x375.png\" alt=\"Import.io bulk extract\" width=\"700\" height=\"375\" title=\"\"><\/p>\n<p>&nbsp;<\/p>\n<p>10. Klik op <strong>Run Queries<\/strong> en wacht op het resultaat<\/p>\n<p>11. Klik daarna op\u00a0<strong>Export<\/strong>, en vervolgens\u00a0<strong>Spreadsheet<\/strong> om de file op te slaan als csv bestand<\/p>\n<p>&nbsp;<\/p>\n<p><img loading=\"lazy\" decoding=\"async\" src=\"http:\/\/www.socialmediasocialmedia.nl\/strategie_nieuws\/wp-content\/uploadsnieuwssocial\/2015\/12\/webscraping_4-700x375.png\" alt=\"Import.io extract\" width=\"700\" height=\"375\" title=\"\"><\/p>\n<p>&nbsp;<\/p>\n<p>12. Open het csv-bestand in je spreadsheet.<\/p>\n<h2>De resultaten<\/h2>\n<p>Vervolgens schoon je de data een beetje op en haal je daar met een Pivot table eenvoudig wat cijfers uit, zoals de top 3 auteurs van 2015\u00a0naar\u00a0aantal artikelen en totaal aantal views.\u00a0Wil je zelf met de data aan de slag, maak dan een kopie van deze\u00a0<a href=\"http:\/\/bit.ly\/nwsscldata\" target=\"_blank\" rel=\"noopener\">spreadsheet<\/a>.<\/p>\n<p>De tussenstand van 19 december 2015:<\/p>\n<ol>\n<li>Redactie 434 posts\u00a0&#8211; \u00a07,6 miljoen views.<\/li>\n<li>Patrick Petersen 320 posts\u00a0&#8211;\u00a05,5 miljoen views.<\/li>\n<li>Social Recruiter 227 posts-\u00a03,6 miljoen views.<\/li>\n<\/ol>\n<h2>Ge\u00efnspireerd?<\/h2>\n<p>Wil je zelf met de data aan de slag, maak dan een kopie van deze\u00a0<a href=\"http:\/\/bit.ly\/nwsscldata\" target=\"_blank\" rel=\"noopener\">spreadsheet<\/a>. Want er is nog\u00a0veel meer informatie uit te halen. En wat als je deze data combineert met een extractie van de inhoud van elk artikel\u00a0of het aantal comments?\u00a0Daar ga ik graag een volgende keer dieper op in&#8230;<\/p>\n<p>Nu de kerstvakantie is begonnen, is dit misschien het uitgelezen moment om je eigen idee\u00ebn uit te proberen tussen de familiebezoeken door. Ik wens je dan ook veel succes met experimenteren en natuurlijk hele fijne feestdagen!<\/p>\n","protected":false},"excerpt":{"rendered":"<p>&#46;&#46;&#46;<\/p>\n","protected":false},"author":169,"featured_media":357686,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[338],"tags":[5884,5885,5450,5883,5882],"class_list":["post-357585","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-nieuws-tool-ai-business-marketing-ai-modellen","tag-growth-hacking","tag-import-io","tag-nieuws-social","tag-patric-van-maaren","tag-web-scraping"],"_links":{"self":[{"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/posts\/357585","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/users\/169"}],"replies":[{"embeddable":true,"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/comments?post=357585"}],"version-history":[{"count":0,"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/posts\/357585\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/media\/357686"}],"wp:attachment":[{"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/media?parent=357585"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/categories?post=357585"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.nieuws.marketing\/strategie_nieuws\/wp-json\/wp\/v2\/tags?post=357585"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}