Le Botservatoire , n°24 – Keenable.ai
Le Botservatoire , n°24 – Keenable.ai21 septembre 2026Depuis quelques posts, Botscorner s’attache Ă  prĂ©senter des datasets et des plateformes de services pour agents IA dans ses botservatoires. Ces datasets permettent d’accĂ©der anonymement et pour un prix modique Ă  des bases de donnĂ©es fraiches, enrichies et standardisĂ©es. Portrait-Robot de Keenable.ai Keenable est une entreprise d’infrastructure d’IA, axĂ©e sur la recherche, fondĂ©e par deux ingĂ©nieurs issus d’Amazon et de Yandex, qui se consacre Ă  la recherche sur le Web pour des applications d’IA Ă  grande Ă©chelle. Keenable dĂ©veloppe des systèmes et de nouvelles primitives de rĂ©cupĂ©ration d’informations qui rendent les donnĂ©es du Web accessibles aux modèles. Ils proposent ces systèmes aux laboratoires d’IA, aux plateformes d’infĂ©rence et aux chercheurs. Dans un article de TechCrunch, Keenable indique qu’elle « construit un index de recherche web comptant plus de 100 milliards de documents » et que son API est « dĂ©jĂ  utilisĂ©e en production par plusieurs laboratoires d’IA et fournisseurs de services d’infĂ©rence, aussi bien lors de la phase d’entraĂ®nement qu’en phase d’exĂ©cution ». L’entreprise ambitionne de concurrencer Google Search grâce au « Web Query Language », un langage conçu pour aider les systèmes d’IA Ă  rĂ©pondre Ă  des questions en combinant des informations provenant de diverses sources du Web. Ses concurrents sont Exa et Brave. Les fondateurs se plaignent des Ă©normes coĂ»ts qui semblent poser un problème majeur. Ils font peut-ĂŞtre rĂ©fĂ©rence aux coĂ»ts de licences des contenus. Keenable propose une Time Machine: une API de recherche temporelle qui vous permet d’effectuer des recherches parmi les versions antĂ©rieures de pages web et de rĂ©cupĂ©rer du contenu issu d’instantanĂ©s historiques spĂ©cifiques. des prix bas pour ces Search APIs for AI agents : -For AI Agent builders and AI Enthusiasts : 0,004$ per request -For AI Labs and Inference platforms : 0,001$ per request at 100 RPS+ Stats Keenable sur les Ă©diteurs Français branchĂ©s sur Botscorner.com: Stats Keenable sur les Ă©diteurs Canadiens branchĂ©s sur Botscorner.com: Robots.txt : en septembre 2026, les Ă©diteurs ne mentionnent pas encore explicitement ce bot sur leurs fichiers Robots.txt. Quand un prĂ©ambule aux « disallow » interdit l’accès aux robots d’entrainement IA, il semble que Keenable n’en tienne pas compte. [...]Lire la suite…
Le Botservatoire , n°23 – Dola AI, le ChatBot de Bytedance (hors Chine)
Le Botservatoire , n°23 – Dola AI, le ChatBot de Bytedance (hors Chine)15 septembre 2026les prĂ©cĂ©dents Botservatoires Doubao est un assistant d’intelligence artificielle dĂ©veloppĂ© par ByteDance, mis Ă  disposition du public mi 2023. Il est rapidement devenu très populaire en Chine (environ 60 millions d’utilisateurs actifs mensuels annoncĂ©s). Sur les sites des Ă©diteurs suivis par Botscorner, on voit le « ByteSpider », robot gĂ©nĂ©rique de Bytedance. On voit Ă©galement d’autres services identifiĂ©s de ByteDance, comme les services de TikTok. Mais depuis dĂ©but septembre 2026, on peut voir apparaitre un nouveau bot qui prend la place de ByteSpider. Pour l’instant, ce coming-out a eu lieu sur les sites de deux Ă©diteurs, l’un Français, l’autre Canadien. Ce nouveau bot appartient donc Ă : Dola AI Le user agent de Dola a donc pris la place, chez ces deux Ă©diteurs, du bot gĂ©nĂ©rique « ByteSpider Â» sur les IPs hĂ©bergĂ©es AWS. Dola.com se prĂ©sente comme un ChatBot classique, avec une interface très sobre comme celles de ses concurrents. On y trouve quelques liens vers la crĂ©ation d’images, la rĂ©daction, la crĂ©ation de vidĂ©os, la traduction, les devoirs… Dola.com ne consulte pas “robots.txt” avec son user agent, c’est une action effectuĂ©e par ByteSpider Stats sur Botscorner.com:  Dola AI en France (dĂ©but) [...]Lire la suite…
The Botservatory , n°22 – Reflection.ai
The Botservatory , n°22 – Reflection.ai10 septembre 2026Every day, hundreds of crawlers collect data from the websites of radio, TV, online, and print publishers. They perform monitoring, analysis, and summaries, providing the high-quality big data essential to AI. previous botservatories Reflection.ai describes itself as “a research lab making intelligence open and accessible for everyone to use, customize, and build on. Our team previously built frontier LLMs (=the most advance, powerful)  at labs like DeepMind, OpenAI, and Anthropic”. Reflection.ai was Launched late 2024, by Misha Laskin, CEO (contributions to the Gemini / post-training systems and reinforcement learning research) and Ioannis Antonoglou ( former DeepMind researcher, involved in AlphaGo / reinforcement learning and deep model research). Market: Reflection.ai , backed by Nvidia, is already partnering with Dell , SpaceX , European AI infrastructure company Nebius , the US Dept of Energy … Reflection CEO confirms latest funding round closed at $25 billion pre-money valuation. Reflection.ai asks for robots.txt , Stats on Botscorner.com: Reflection.ai’s volumes are increasing daily on French publishers And on Canadian publishers [...]Lire la suite…
Le Botservatoire , n°21 – EXA.ai, dataset for AI agents
Le Botservatoire , n°21 – EXA.ai, dataset for AI agents3 septembre 2026Depuis quelques posts, Botscorner s’attache Ă  prĂ©senter des datasets dans ses botservatoires. Ces datasets permettent, parfois Ă  titre gracieux, d’accĂ©der anonymement Ă  des bases de donnĂ©es fraiches, enrichies et standardisĂ©es, Ă  très bas coĂ»t. Portrait-Robot de exa.ai, dataset for AI-agents Exa AI est une plateforme de recherche avancĂ©e par IA qui fournit des donnĂ©es web fraĂ®ches aux LLMs. EXA indexe le web chaque minute pour constituer des bases de donnĂ©es pertinentes. https://moge.ai/fr/product/exa-ai Sa vraie plus-value rĂ©side dans son API de recherche web basĂ©e sur le sens : Exa amĂ©liore les rĂ©ponses des modèles d’IA en baissant le risque d’hallucinations : idĂ©al pour la gĂ©nĂ©ration augmentĂ©e par rĂ©cupĂ©ration de donnĂ©es. «La diffĂ©rence dans les rĂ©sultats est Ă©vidente. Alors que la recherche traditionnelle retourne des pages web brutes nĂ©cessitant un traitement approfondi, Exa propose un contenu propre, analysĂ©, prĂŞt Ă  ĂŞtre consommĂ© par l’IA. Vous obtenez des scores de pertinence fiables, non pas basĂ©s sur la manipulation SEO mais sur la similaritĂ© sĂ©mantique rĂ©elle». Avec Exa, l’IA a accès Ă  des informations pertinentes et Ă  jour. Des hallucinations en nette baisse augmentent la confiance des clients des IA. https://demos.exa.ai/paper-search/how-it-works Les tarifs : 0,001$/content. 1.         obĂ©ir Ă  robots.txt : exa.ai consulte robots.txt 2.         Stats sur Botscorner. Les stats Exa montrent une activitĂ© consĂ©quente sur les sites (France et Canada) Ă©quipĂ©s de Botscorner : jusqu’à 110.000 pages sur une journĂ©e. [...]Lire la suite…
botservatoire n° 20 – dataset & marketplace
botservatoire n° 20 – dataset & marketplace20 octobre 2025Depuis quelques posts, Botscorner s’attache Ă  prĂ©senter des datasets dans ses botservatoires. Ces datasets prĂ©sentent un intĂ©rĂŞt majeur : ils permettent, parfois Ă  titre gracieux, d’accĂ©der Ă  des bases de donnĂ©es enrichies et standardisĂ©es. PlutĂ´t que d’aller nĂ©gocier des accords dispendieux avec les Ă©diteurs ou leurs reprĂ©sentants, ces bases sont des marketplaces prisĂ©es. cestquilepatron.com screenshot Pourquoi acheter ses datas auprès des marketplaces plutĂ´t qu’auprès des Ă©diteurs ? – MĂŞme quand le dataset affiche un user agent qui l’identifie sur toutes ses sessions, mĂŞme quand le dataset a signĂ© un accord avec un Ă©diteur ou son ayant-droit, le client utilisateur final de la base est mĂ©caniquement anonymisĂ©. Que prĂ©voit le contrat qui lie la marketplace Ă  son client? – la base est multi-titres, le contenus est frais, le format est standardisĂ©, les contenus peuvent ĂŞtre enrichis, le guichet est unique, le tarif est très bas, le risque d’un audit sur les utilisations très Ă©loignĂ©. -quand ces bases sont gratuites, les donnĂ©es sont alors partagĂ©es « for good Â» (la recherche). Vous pouvez nĂ©anmoins faire un don dĂ©fiscalisĂ© (ex: commoncrawl). Un don au dataset, pas Ă  l’éditeur. -certaines bases se constituent sur la base de recherches universitaires . Mais de ces recherches publiques peuvent sortir des entreprises privĂ©es. Par exemple, EventRegistry est une spin-off du JoĹľef Stefan Institute . C’est dĂ©sormais une entreprise indĂ©pendante qui Ă©dite Newsapi.ai .   -Quand ces bases sont payantes, le tarif est compĂ©titif. Quelle est la part de rĂ©munĂ©ration des Ă©diteurs dans le prix Ă  l’article proposĂ© par ces quelques datasets ? voici une revue des pages de tarifs de quelques unes de ces marketplaces: newsapi.ai diffbot.com brightdata.com/ zyte.com archive.org (free, open for donation) Commoncrawl.org (free, open for donation) Opoint.com (non publiĂ© sur le site, mais a signĂ© avec le CFC) webz.io (des datas gratuits Webhose et des datas payants, tarif non publiĂ© sur le site, mais a signĂ© avec le CFC) etc. -parfois adossĂ©es Ă  des services de proxies tournants (ips jetables, bypass captchas), sur lesquels on pose des scrapers de contenus, le client ne paie que le contenu effectivement collectĂ©. Moralité : si l’éditeur ou son mandataire n’est pas co-contractant, la marketplace va ĂŞtre tentĂ© de privilĂ©gier la fluiditĂ© d’un accord technique très peu rĂ©munĂ©rateur pour l’éditeur. [...]Lire la suite…
The Botservatory , n°19 – Supabase , dataset
The Botservatory , n°19 – Supabase , dataset9 octobre 2025previous botservatories Every day, hundreds of crawlers collect data from the websites of radio, TV, online, and print publishers. They perform monitoring, analysis, and summaries, providing the high-quality big data essential to AI. Supabase, an open source alternative to Firebase : “Build in a weekend. Scale to millions. Supabase is the Postgres development platform. Start your project with a Postgres Database, Authentication, instant APIs, and realtime subscriptions”. You can plug your Supabase project on digital assistants like N8n or Loveable, they will handle repetitive tasks (such as scraping external datas). An example below with N8N.io: obey robots.txt : As each project is independent, robots.txt may or may not be consulted depending on the project manager 2.       Stats on Botscorner (on french publishers/weekly) Supabase has 135 employees, 21M$ revenues , 398M$ fundings, estimation: 2B$ (progressing). [...]Lire la suite…
The Botservatory , n°18 – DataforSEO , dataset
The Botservatory , n°18 – DataforSEO , dataset11 septembre 2025Every day, hundreds of crawlers collect data from the websites of radio, TV, online, and print publishers. They perform monitoring, analysis, and summaries, providing the high-quality big data essential to AI. previous botservatories Data for SEO , is a for-profit Organization, with desks in Estonia and Ukraine. It was founded in 2016 by Nick Chernets: Founder and CEO, with this object: “Powerful API Stack For Data-Driven Marketers : We provide comprehensive SEO and digital marketing data solutions via API. Our vision is to be a leader in data-driven marketing by leveraging data to equip businesses with the tools they need to create efficient and effective SEO strategies. Data is the new oil, and we are committed to providing the highest-quality fuel to power our clients’ SEO tools” DataforSEO offers services linked to SEO , but not only. Once the contents are collected, there is a huge database ready to be monetized: Data for AI training (The DataForSEO AI Optimization API equips you with access to keyword data enriched with search volume metrics) “Our custom data collection services are designed to be the ultimate solution for all your AI initiatives. Whether you’re developing a new algorithm, refining an existing machine-learning model, or looking to expand your training dataset, we can deliver high-quality data at the scale your project requires to succeed”. Content generation (DataForSEO Content Generation API is designed to facilitate the process of content creation. Its NLP model is capable of generating unique paragraphs of text, paraphrasing content, detecting grammar mistakes, and more.) Content analysis : “Content Analysis API is a scalable solution for discovering citations of target keywords or brand names and analyzing relevant sentiments”. DataForSEO : Costumers and prices: obey robots.txt : looks for robots.txt. Only one French publisher mentionned “dataforseo” disallowed this 9-11, 2025 (but DataforSeo scraps anyway). The UAs are: RSiteAuditor and DataForSeoBot/1.0 Stats on Botscorner from 2022 (on french publishers/monthly) DataforSEO stats show a huge activity on french websites plugged on Botscorner : more than +220.000 pages / 24h. DataforSEO has 29 employees, for a 3+M$ 2025 revenue [...]Lire la suite…
The Botservatory , n°17 – Allenai.org/olmo , open LLM & dataset
The Botservatory , n°17 – Allenai.org/olmo , open LLM & dataset2 juillet 2025previous botservatories Every day, hundreds of crawlers collect data from the websites of radio, TV, online, and print publishers. They perform monitoring, analysis, and summaries, providing the high-quality big data essential to AI. The Allen Institute for Artificial Intelligence (AI2), LLM and open dataset for AI The Allen Institute, as CommonCrawl, is a non-profit Organization. It was founded in 2014 by Paul Allen, philanthropist and Microsoft co-founder, to find transformative ways to develop AI. As a non-profit AI research institute,  AI2 develops foundational AI research and innovation to deliver real-world impact through large-scale open models, data, robotics, conservation, and beyond. Among other projects, AI2 developped LLMs such as OLMo, TĂĽlu, provides datasets available on Hugging Face OLMo 2, the best fully open language model to date, including a family of 7B, 13B, and 32B models trained up to 6T tokens. OLMo 2 outperforms other fully open models and competes with open-weight models like Llama 3.1 8B. AI2 partners with Gates Foundation, University of Washington and NAIRR and 500+ academic journals on Semantic Scholar project obĂ©ir Ă  robots.txt : on ne voit pas AI2 consulter robots.txt Stats sur Botscorner. AI2 Olmo’s stats show a huge activity on french websites plugged on Botscorner : more than +210.000 pages / 24h. 3. Estimated revenue $35M per year / 325 employees (source: Growjo) [...]Lire la suite…
ils nous font confiance
ils nous font confiance10 juin 2025Botscorner provides B2B information on bots (media monitoring, artificial intelligence, SEO, RSS, etc.) allowing B2B syndication and subscription services of titles to regulate access to its copyrighted content and sign contracts. France https://www.bfmtv.com/   https://rmc.bfmtv.com/ https://www.lesechos.fr/     https://www.lefigaro.fr/ https://www.leparisien.fr/ https://www.ouest-france.fr/ https://www.lepoint.fr/ https://www.prismamedia.com/https://www.louishachettegroup.com/ https://www.challenges.fr/ https://www.sciencesetavenir.fr/ https://www.infopro-digital.com https://1health.fr/ https://www.editions-lva.fr/https://www.newsassurancespro.com/seroni     Canada https://www.lapresse.ca/https://www.quebecor.com/en/our-activities https://www.ledevoir.com/ Rights collection and distribution company https://www.copibec.ca/ [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°16 – Brightdata.com
Le Botservatoire , le bulletin des crawlers commerciaux, n°16 – Brightdata.com10 avril 2025Portrait-Robot de Brightdata.com, dataset for AI & media monitoring Les prĂ©cĂ©dents botservatoires Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print. Ils opèrent pour les activitĂ©s de veille, des analyses, des rĂ©sumĂ©s, fournissent le big data de qualitĂ© indispensable aux IA … Portrait-Robot de Brightdata (dataset for AI, media monitoring) Brightdata propose de très nombreux services, notamment: -les proxies tournants (qui permettent de multiplier les ips locales temporaires), -le scraping de contenus -les apis d’accès Ă  des datasets… Brightdata nous garantit un scraping « éthique » grâce Ă  son Brightbot, qui respecte un fichier « collector.txt » , une sorte de robots.txt dĂ©diĂ© Ă  ce type de scraping ( ?). Brightbot monitore les sites scrapĂ©s pour adapter son activitĂ© Ă  la charge supportable par les sites ciblĂ©s. Dans la foulĂ©e, Brightdata.com dĂ©taille son scraping Ă©thique, mais sans Brightbot cette fois, avec -des user agents de navigateurs identifiĂ©s comme des internautes –des proxies rotatifs, de fausses pages de provenance, de rĂ©solutions de captchas… toutes solutions permettant de collecter les datas nĂ©cessaires aux usages B2B, dans un strict cadre de « data for good » “Data is the fuel that drives AI innovation, and at The Bright Initiative, Bright Data’s data-for-good program, we are committed to harnessing AI’s potential for positive change. Through strategic partnerships, research support, and ethical data access, we empower our partners to create meaningful social impact. The Bright Initiative provides pro-bono access to Bright Data’s industry-leading data collection technology and datasets to nonprofit organizations, academic institutions, researchers, and public bodies working in the AI for Good space.” Le scrap peut se faire via IA : Brightdata annonce plus de 20.000 clients, Chiffre d’affaires estimĂ© : $220.1M per year, 1084 Employees (+30%) obĂ©ir Ă  robots.txt : on ne voit pas Brightdata consulter robots.txt Stats sur Botscorner: Les stats Brightdata montrent une activitĂ© consĂ©quente sur les sites (France) Ă©quipĂ©s de Botscorner : jusqu’à 50.000 pages sur une journĂ©e. [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°15 – ZYTE.com
Le Botservatoire , le bulletin des crawlers commerciaux, n°15 – ZYTE.com3 mars 2025Portrait-Robot de Zyte.com Les prĂ©cĂ©dents botservatoires Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print. Ils opèrent pour les activitĂ©s de veille, des analyses, des rĂ©sumĂ©s, fournissent le big data de qualitĂ© indispensable aux IA … Portrait-Robot de ZYTE.com, “the best place to host Scrapy spiders” Sur son site, Zyte propose un service « News & Article data : Accurate articles and news data from global publishers and the largest news websites in the world”. Zyte dĂ©montre sa bonne connaissance des sites de news : « Articles and news data comes in all shapes and sizes. We get it all”. 1-“Mainstream broadcast : These are large organizations that have dominated the news world for many years. They include TV networks, newspapers, press releases, and radio stations that are widely recognized and trusted by the public”. 2-“Industry and vertical : These websites focus on specific industries or niches, providing news and information that is relevant to professionals in those fields”. 3-“Alternative media and independents : These websites operate outside of the traditional, corporate-owned media landscape. They may provide alternative perspectives on news and events”. 4-“Groups, individuals, and influencer : These web pages are created and run by individuals or groups, such as bloggers, vloggers, or podcasters”. 5-“Online aggregators : These websites collect and curate crucial news data from various sources and present them to users in a single location”. 6-“News blogs : These websites are dedicated to latest news articles and opinion, often with a specific focus or niche”. 7-“Video news : Video news websites provide news coverage through video content, which can be more difficult to collect and parse data from than text-based news”. 8-“Social media : Social media platforms where journalists and publications source stories and where many brands self-publish and promote their content”. Ă€ quoi servira ce scraping ? “Brand monitoring & reputation management , Market research , Content optimization (SEO) , News aggregation , Tackling misinformation , Building AI models and algorithms , Creating dashboards , Ad and affiliate tracking”. La factorisation du scrap donne un prix de service assez intĂ©ressant, que ce soit pour gĂ©rer son scraping ou pour l’acquisition de donnĂ©es dĂ©jĂ  extraites et mises en forme. On notera que IPXO, une place de marchĂ© pour louer des adresses IPs, se prĂ©sente comme « un partenaire de confiance en matière de location d’IPs pour les entreprises dans plus de 75 secteurs d’activitĂ© Â», et avance quelques services partenaires dont « Zyte Â». D’ailleurs, parmi les diffĂ©rents usages possibles des ips de location, on peut trouver le « data crawling and data extraction Â»  : “With the support of professional IP leasing services provided by IPXO, a leading web exfiltration company in Europe can continue introducing innovations and improving the quality of services to guarantee quick and efficient data crawling and data extraction”. 2. Estimated Revenue, Valuation, employee data IPXO.com estimated annual revenue is currently 8M$ per year. Employee : 62 Zyte (ScrapingHub) estimated annual revenue is currently 27M$ per year. Employee : 171 3. stats on Botscorner [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°14 – Timpi.io dataset
Le Botservatoire , le bulletin des crawlers commerciaux, n°14 – Timpi.io dataset10 dĂ©cembre 2024Portrait-Robot de Timpi.io, dataset for AI & media monitoring Les prĂ©cĂ©dents botservatoires Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print. Ils opèrent pour les activitĂ©s de veille, des analyses, des rĂ©sumĂ©s, fournissent le big data de qualitĂ© indispensable aux IA … Timpi.io nous propose de participer Ă  la dĂ©mocratisation de l’information mondiale (et de gagner des rĂ©compenses). L’index Web de Timpi repose sur un rĂ©seau dĂ©centralisĂ© de nĹ“uds gĂ©rĂ©s par des utilisateurs indĂ©pendants. « Giving you the power of data » : Nos (sic) donnĂ©es sont utilisĂ©es pour dĂ©velopper des applications et informer les entreprises. Par exemple, l’entraĂ®nement de l’IA : Utilisez de vastes ensembles de donnĂ©es pour entraĂ®ner vos modèles d’IA avec des informations diverses et complètes provenant du Web, amĂ©liorant ainsi la prĂ©cision et les performances. Le moteur de recherche Timpi, enrichi par Wilson (l’IA de Timpi), s’appuie sur un modèle de gouvernance dĂ©centralisĂ©. Timpi utilise une technologie « DePIN » (Decentralized physical infrastructure network) Les DePINs sont le pont entre les mondes physique et numĂ©rique. Ils utilisent des blockchains et offrent des rĂ©compenses sous forme de jetons pour les services enregistrĂ©s publiquement. Les DePINs crĂ©ent un rĂ©seau pour les objets physiques, tels que le Wi-Fi et le stockage de donnĂ©es, permettant aux gens de partager leurs ressources directement avec d’autres utilisateurs sans avoir besoin d’un intermĂ©diaire. cointelegraph.com Timpi propose l’accès au plus grand ensemble de donnĂ©es au monde avec plus de 5 milliards de pages Web. Wilson AI les versions futures de WilsonAI offriront encore plus d’informations en temps rĂ©el, de personnalisation pour les utilisateurs 1. obĂ©ir Ă  robots.txt les ips de Timpi ne passent pas sur robots.txt. 2. Stats sur Botscorner. Les stats Timpi montrent une activitĂ© consĂ©quente sur certains sites Ă©quipĂ©s de Botscorner. Deux exemples ci-dessous de scraps Timpi sur des sites de presse, dans deux pays diffĂ©rents (jusqu’à 160.000 pages sur une journĂ©e sur un site) [...]Lire la suite…
Botscorner : l’innovation au service de la protection des contenus et des données
Botscorner : l’innovation au service de la protection des contenus et des donnĂ©es26 novembre 2024interview publiĂ©e sur le site du GESTE Yan Gilbert Ă©tait le Directeur de la diffusion numĂ©rique du groupe Nouvel Observateur de 2000 Ă  2015. Il a ensuite dirigĂ© le GIE Panorama de Presse de 2010 Ă  2015. Depuis 2017, il occupe la fonction de Directeur GĂ©nĂ©ral au sein de Clipeum, Ă©diteur de la solution innovante Botscorner. Pouvez-vous nous expliquer le fonctionnement de Botscorner ?  Botscorner analyse le trafic des robots et des proxies sur les sites de presse. L’éditeur envoie automatiquement ses logs de sessions, qui sont enrichis par Botscorner, grâce aux milliers d’informations accumulĂ©es et mises Ă  jour depuis son lancement en 2017.  -Les visites « internautes » ne sont ni enrichies ni suivies.   -Les sessions « robots » sont enrichies et classĂ©es par typologie de marchĂ©. Cela permet de suivre distinctement les bots par activitĂ© et par modèle Ă©conomique : Searchbots, AI, datasets, media monitoring, sites parasites, gestionnaires RSS, SEO, rĂ©gie pub… Ces activitĂ©s sont monĂ©tisables.  –Les sessions « proxies » Ă©manant d’entreprises, d’associations, d’administrations, d’universitĂ©s… sont Ă©galement renseignĂ©es, Ă©ventuellement avec les infos « paywall », afin que l’éditeur puisse adresser des prospects ou de comparer les infos avec ses donnĂ©es « grands comptes ». Comment cette technologie permet-elle d’identifier et de rĂ©guler les robots accĂ©dant aux contenus protĂ©gĂ©s par le droit d’auteur ?   Cela dĂ©pend des sites, mais on observe gĂ©nĂ©ralement qu’une moitiĂ© des demandes de pages sur les sites de presse ne sont pas effectuĂ©es par des internautes mais par des programmes (IA, mediamonitoring, datasets, searchbots, SEO, …). Botscorner conjugue diffĂ©rents moyens pour identifier les bots, comme le ferait une Bot Mitigation (identification technique bots/humains et rĂ©ponse en temps rĂ©el). La finalitĂ© de Botscorner n’est pas de traiter des questions de sĂ©curitĂ© (DDos, SQL injection, etc.) mais d’identifier les actions automatiques et de renseigner le trafic B2B. Identifier la personne morale renseigne sur le modèle Ă©conomique. Cela permet de comprendre Ă  quoi vont servir les donnĂ©es rĂ©coltĂ©es : comment le « propriĂ©taire » des robots en tire parti pour son service. Ces informations pour action, remontĂ©es par Botscorner, concernent diffĂ©rents services de l’éditeur. En effet, Botscorner n’agit pas en « coupure » comme le ferait une bot mitigation. La rĂ©gulation reste dans la main de l’éditeur, qui va dĂ©cider du traitement appropriĂ©, en fonction de sa stratĂ©gie, service par service. Par exemple : blocage de crawls anonymes par le service technique, recueil de preuves par le service juridique, nĂ©gociation par le service syndication.  Botscorner a annoncĂ© 2 partenariats importants (Le Monde et Ouest France). Pouvez-vous nous expliquer en quoi consistent ces partenariats et quels bĂ©nĂ©fices les Ă©diteurs vont-ils pouvoir en tirer ?   Et nous allons bientĂ´t annoncer d’autres partenariats !   Je ne peux pas m’exprimer Ă  la place des clients de Borscorner. Tout dĂ©pend de leur stratĂ©gie. Chaque Ă©diteur a des utilisations assez diffĂ©rentes des informations remontĂ©es. En fonction de l’approche de chacun, ces informations intĂ©ressent les services syndication, business dev, abonnements grands comptes, juridique, technique… Botscorner remonte les informations sur les bots en fournissant aux services de l’éditeur :   –La fiche contacts de l’entreprise qui active le bot  –La nature du trafic (proxy ou bot)  –Le volume et la nature des donnĂ©es collectĂ©es (article, jpg)  –Les infos techniques qui permettent de bloquer les bots si la nĂ©gociation s’enlise  Dès lors, certains Ă©diteurs recourent Ă  Botscorner uniquement pour identifier les crawlers indĂ©sirables sur leur base de donnĂ©es, en vue de les bloquer. En revanche, d’autres utilisent Ă  plein toutes les informations prĂ©sentĂ©es, en flĂ©chant les proxies entreprises/administrations vers le service abonnements grands comptes, les crawlers B2B vers le licensing/business dĂ©veloppement et les scrapers anonymes vers le service technique, entre autres.  Quelles synergies souhaitez-vous dĂ©velopper avec chacun d’eux ?  Des contacts rĂ©guliers se mettent en place, au dĂ©but pour se former sur l’outil, puis pour faire le point sur l’activitĂ© des bots, lever des interrogations sur certains crawlers, etc. GĂ©nĂ©ralement, les sessions hebdomadaires ou bimensuelles durent d’une demi-heure Ă  une heure. MĂŞme si cela concerne gĂ©nĂ©ralement les services commerciaux, nous avons aussi des Ă©changes avec les services techniques et juridiques.   Quelles sont les mesures de protection des donnĂ©es que Botscorner met en place pour garantir la confidentialitĂ© des informations collectĂ©es lors de l’identification des robots ?  La protection des donnĂ©es est cruciale. Nous ne transmettons aucune donnĂ©e Ă  des tiers autre que l’éditeur lui-mĂŞme, qui nous a fourni ses logs pour analyse. Et, sur son dashboard, l’éditeur accède uniquement aux informations concernant ses propres titres. Par ailleurs, nous avons assurĂ© notre mise en conformitĂ© au RGPD, le règlement europĂ©en sur la protection des donnĂ©es, avec l’aide d’un cabinet spĂ©cialisĂ©. La durĂ©e de conservation des donnĂ©es envoyĂ©es par les Ă©diteurs est limitĂ©e : nous supprimons tous les informations après 24h.   Quels sont les principaux dĂ©fis actuels rencontrĂ©s par Botscorner ? Droits voisins ?    Effectivement, la loi sur les droits voisins, mais aussi l’arrivĂ©e des IA grand public, ont entraĂ®nĂ© beaucoup d’intĂ©rĂŞt pour Botscorner.  Pour nous, cela gĂ©nère une adaptation permanente aux techniques de crawl, et une veille active sur toutes les utilisations des donnĂ©es et les nouveaux modèles Ă©conomiques. Cela implique une mise Ă  jour quotidienne de la cartographie globale des bots, et les remontĂ©es d’informations sur le marchĂ© B2B.   Quelles sont les prochaines Ă©tapes de Botscorner (en termes d’innovation et dĂ©veloppement) pour rĂ©pondre aux besoins futurs des Ă©diteurs ? Nous avons des clients dans plusieurs pays, sur deux continents. Grâce Ă  leurs remarques et Ă  leurs retours d’expĂ©rience, le service ne cesse de progresser ! Les prochaines Ă©tapes consistent Ă  rĂ©pondre toujours mieux aux attentes de nos clients, Ă  amĂ©liorer le service grâce Ă  leurs suggestions, et Ă  continuer de nous dĂ©velopper, en France et Ă  l’international.  Le Geste: Depuis sa crĂ©ation en 1987, le GESTE s’est fait fort d’analyser les mutations du modèle Ă©conomique des Ă©diteurs de contenu et services en ligne afin de permettre une meilleure comprĂ©hension des enjeux posĂ©s par la transformation numĂ©rique et l’émergence de conditions Ă©conomiques, lĂ©gislatives et concurrentielles. Aujourd’hui prĂ©sidĂ© par Bertrand GiĂ©, Directeur dĂ©lĂ©guĂ© du pĂ´le News du Groupe Figaro, le GESTE fĂ©dère une centaine d’éditeurs en ligne, tous horizons confondus : presse en ligne, mĂ©dias digitaux et audiovisuels, plateformes de musique, services mobiles et vocaux… Le GESTE, lieu d’échanges et de veille permet Ă  ses membres d’avoir un temps d’avance sur les dĂ©bats qui font l’actualitĂ© et les positions lĂ©gislatives. Des solutions concrètes et applicables pour un rĂ©el dĂ©veloppement Ă©conomique y sont dĂ©battues avant d’être soumises au gouvernement et aux instances publiques. [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°13 – NewsAPI.AI (dataset)
Le Botservatoire , le bulletin des crawlers commerciaux, n°13 – NewsAPI.AI (dataset)17 octobre 2024Portrait-Robot de EventRegistry, maison mère de NEWSAPI.AI, dataset for AI & media monitoring Les prĂ©cĂ©dents botservatoires Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print. Ils opèrent pour les activitĂ©s de veille, des analyses, des rĂ©sumĂ©s, fournissent le big data de qualitĂ© indispensable aux IA … Portrait-Robot de NewsAPI.AI et EventRegistry.org (dataset for AI, media monitoring) Forbes nous prĂ©sente EventRegistry comme « un service de surveillance mondiale des mĂ©dias en temps rĂ©el, grâce Ă  des algorithmes de recherche multilingues et une extraction approfondie d’informations afin de transformer les donnĂ©es en une plateforme dĂ©cisionnelle significative Â». Vous cherchez des bases d’articles de presse de qualitĂ©? Ne cherchez plus: “ Get articles from 150,000 news publishers worldwide”“ Get the full news content as well as information about the mentioned entities, topics and sentiment.” “Discover news content minutes after it is published” “Archives since 2014” “World’s leading companies are using NewsApi.ai” Clients: Spotify, IBM, Palantir, Bloomberg, Merck, Accenture, BASF, Johnson&Johnson, Airbus, Barclays, Disney, PWC, arabesque, OECD, BASF, McKinsey, Gouvernement Slovenie… Eventregistery a obtenu des financements de la part du fonds Google’s Digital News Initiative. Le RĂ©seau acadĂ©mique et de recherche de SlovĂ©nie, Arnes, propose une prĂ©sentation d’EventRegistry 1. obĂ©ir Ă  robots.txt : EventRegistry utilisait un user agent explicite. Les quelques Ă©diteurs qui le bloquaient ont peut-ĂŞtre eu raison de cet affichage ? DĂ©sormais, le user agent n’apparait plus, mais le trafic n’a pas baissĂ©, au contraire. Ces ips ne passent de toutes façons pas sur robots.txt. 2. Stats sur Botscorner. Les stats d’EventRegistry, dont le service a Ă©tĂ© lancĂ© en 2017, montrent une activitĂ© consĂ©quente sur les sites Ă©quipĂ©s de Botscorner. 3. Tarifs [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°12 – Adata.pro
Le Botservatoire , le bulletin des crawlers commerciaux, n°12 – Adata.pro9 octobre 2024Portrait-Robot de ADATA.PRO, une sociĂ©tĂ© multiservices (dataset for AI, media monitoring …) Les prĂ©cĂ©dents botservatoires Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print. Ils opèrent pour les activitĂ©s de veille, des analyses, des rĂ©sumĂ©s, fournissent le big data de qualitĂ© indispensable aux IA … ADATA.PRO, une sociĂ©tĂ© multiservices (dataset for AI, media monitoring …) Parmi les très nombreux services offerts par Adata.pro, on peut trouver la rubrique « Data Solutions Â», prĂ©sentĂ©e ainsi (extraits) : Adata.pro is a trusted partner to data and content aggregators, financial and risk & compliance consultants, and PR agencies internationally. We specialise in content, data and business intelligence services, media monitoring and analysis. Our suite of services spans Data Automation, Data Management, and Training Data for AI Our data automation solutions collect data from various sources, such as databases, APIs, and web scraping. Adata.pro est membre de UpData One Community une organisation qui regroupe des sociĂ©tĂ©s du secteur, et de FIBEP (the world’s media intelligence association). Des fonds EuropĂ©ens aident A Data Pro Ă  dĂ©velopper une technologie pour produire des articles de presse 1. obĂ©ir Ă  robots.txt les ips de Adata.pro prĂ©sentent un user agent d’internaute accĂ©dant au site avec un navigateur. L’éditeur ne peut donc marquer son dĂ©saccord avec ce scraping par ce biais. Ces ips ne verraient de toutes façons pas cette indication, puisqu’elles ne passent pas sur le fichier robots.txt. 2. Stats sur Botscorner. Les stats Adata.pro, dont le service a Ă©tĂ© lancĂ© en 1999, montrent une activitĂ© consĂ©quente sur les sites Ă©quipĂ©s de Botscorner. 3. Estimated Revenue, Valuation, employee data Adata.pro estimated annual revenue is currently 101-500M$ per year. Employee : 352 (between 201-500 ) [...]Lire la suite…
Le Botservatoire, le bulletin des crawlers commerciaux, n°11 – Panalis.de
Le Botservatoire, le bulletin des crawlers commerciaux, n°11 – Panalis.de19 septembre 2024Portrait-Robot de Panalis, une sociĂ©tĂ© de media monitoring spĂ©cialisĂ©e « Politique » Les prĂ©cĂ©dents botservatoires Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print. Ils opèrent pour les activitĂ©s de veille, des analyses, des rĂ©sumĂ©s, fournissent le big data de qualitĂ© indispensable aux IA … Panalis.de prĂ©sente ainsi son service (extraits) : PANALIS Solutions offre la rĂ©ponse digitale Ă  la gestion des affaires publiques, de la veille Ă  l’analyse politique. plus de 1 400 utilisateurs satisfaits au sein d’associations, d’entreprises, d’agences et de l’administration. Suivi politique professionnel pour la France , l’UE , USA, Italie, Autriche PANALIS Monitoring : La base de donnĂ©es PANALIS regroupe plus de 100 000 acteurs du monde politique, Ă©conomique et social et, contient plus 100 millions de publications provenant de plus de 250 000 sources, offrant ainsi la plus grande base de donnĂ©es politique d’Europe. Assistant vocal virtuel (Text-2-speech): RĂ©sumĂ©s et contenus des publications lus Ă  haute voix Niveaux d´informations : Local, National : Institutions, organisations, entreprises, ONG, instituts de recherches, politiciens, experts et mĂ©dias au niveau rĂ©gional et national. International : Des informations parlementaires provenant de plus de 50 pays Ă  travers le monde, institutions et organisations internationales 1. obĂ©ir Ă  robots.txt les ips de Panalis.eu ne passent pas sur robots.txt. Il serait difficile pour un Ă©diteur de mentionner son dĂ©saccord avec ce crawl, car au moment oĂą l’on Ă©crit ces lignes, Panalis n’a pas encore rĂ©digĂ© une page de renseignements sur le user agent affichĂ© par son crawler. Il semble plutĂ´t utiliser des user agents gĂ©nĂ©riques (PHP, Java, etc.) : Proprietary crawler technologies make PANALIS fast, versatile, robust and independent of third-party providers. The diverse data source categories include: Databases, Interfaces to real-time information sources, Website article, Social media, Online media 2. Stats sur Botscorner. Les stats Panalis.de, dont le service a Ă©tĂ© lancĂ© en 2015, montrent une activitĂ© consĂ©quente sur les sites Ă©quipĂ©s de Botscorner, avec jusqu’à 145K requĂŞtes, 50K pages par jour, tous types d’éditeurs. des blocages par moments peuvent gener le crawl par moments. 3. Estimated Revenue, Valuation, employee data PANALIS Solutions GmbH’s estimated annual revenue is currently $1.1M per year. [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°10 – TheHive.AI
Le Botservatoire , le bulletin des crawlers commerciaux, n°10 – TheHive.AI10 aoĂ»t 2024Portrait-Robot de TheHive.ai, un service IA B2B  Les prĂ©cĂ©dents botservatoires Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print. Ils opèrent pour les activitĂ©s de veille, des analyses, des rĂ©sumĂ©s, fournissent le big data de qualitĂ© indispensable aux IA … TheHive.ai prĂ©sente ainsi un Ă©ventail de services allant de la gĂ©nĂ©ration de contenus multimedia Ă  la modĂ©ration, en passant par le suivi de la prĂ©sence des marques et logos dans les medias, la recherche de plagiats Solutions for moderating content of all forms; AI to understand, search, and generate content (videos, texts, images) using prompts. AutoML: Quickly develop and deploy custom models with limited training data. Generate multimodal conversations through natural language prompts Sports, Media, & Marketing. Solutions for measuring sponsorships, monitoring cross-platform advertising, and unlocking premium ad inventory. image Match & Similarity: Find exact and similar matches across the open web or a custom index quelques clients de TheHive.ai 1. obĂ©ir Ă  robots.txt TheHive.ai passe bien sur le fichier robots.txt. Il est nĂ©anmoins difficile pour un Ă©diteur de mentionner son dĂ©saccord avec ce crawl, car au moment oĂą l’on Ă©crit ces lignes, TheHive.ai n’a pas encore rĂ©digĂ© une page de renseignements sur le user agent affichĂ© par son crawler (nous ne l’avons pas trouvĂ©e?). TheHive utilise un crawler : Mozilla/5.0 (compatible; ImagesiftBot; +imagesift.com) 2. Stats sur Botscorner. Les stats de thehive.ai, dont le service a Ă©tĂ© lancĂ© en 2013, montrent une activitĂ© consĂ©quente sur les sites Ă©quipĂ©s de Botscorner: jusqu’à 550 000 requĂŞtes, 380 000 photos et 240 000 pages demandĂ©es par jour, sur tous types d’éditeurs. 3. Estimated Revenue, Valuation, employee data theHive.ai’s estimated annual revenue is currently $156.2M per year theHive.ai’s current valuation is $2B. theHive.ai has 424 Employees source Growjo [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°09 – OpenAI Search
Le Botservatoire , le bulletin des crawlers commerciaux, n°09 – OpenAI Search8 aoĂ»t 2024Portrait Robot de openAI search, un moteur de recherches et de rĂ©ponses. Les prĂ©cĂ©dents botservatoires Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print. Ils opèrent pour les activitĂ©s de veille, des analyses, des rĂ©sumĂ©s, fournissent le big data de qualitĂ© indispensable aux IA … D’OpenAI, on connaissait ChatGPT, qui s’est entrainĂ© pendant des annĂ©es sur divers datasets, le plus connu Ă©tant celui proposĂ© gratuitement par CommonCrawl, et constituĂ© notamment de contenus « presse Â». On dĂ©couvre depuis fin juillet 2024 un nouveau service en version Beta : OpenAI Search OpenAI le dĂ©crit ainsi : « OAI-SearchBot is for search. OAI-SearchBot is used to link to and surface websites in search results in the SearchGPT prototype. It is not used to crawl content to train OpenAI’s generative AI foundation models.«  OpenAI Search lance donc un solide concurrent Ă  Google. Contrairement Ă  son concurrent, le service d’OpenAI ne serait pas basĂ© sur des algorithmes de classement. OpenAI Search va utiliser l’intelligence artificielle pour fournir les rĂ©ponses aux internautes. Il annonce tester dĂ©jĂ  le modèle avec quelques Ă©diteurs. OAISearch affichera les sources ayant permis de formuler la rĂ©ponse rĂ©sumĂ©e donnĂ©e par OAISearch. OAI Search ne donne aucune information sur le modèle Ă©conomique proposĂ© aux Ă©diteurs pour gĂ©nĂ©rer ces rĂ©sumĂ©s sur de l’information Â« temps rĂ©el Â», ni Ă  ce stade sur le taux de clic observĂ© sur les liens proposĂ©s en sidebar Ă  cĂ´tĂ© de la rĂ©ponse claire et concise de OAISearch. Le volume dĂ©jĂ  substantiel d’abonnĂ©s au service ChatGPT, et la dynamique du marchĂ© de l’IA plaident pour une Ă©tude attentive de cette beta version par les Ă©diteurs de presse. extrait du site OpenAI Search: « We’re testing SearchGPT, a prototype of new search features designed to combine the strength of our AI models with information from the web to give you fast and timely answers with clear and relevant sources. We’re launching to a small group of users and publishers to get feedback. While this prototype is temporary, we plan to integrate the best of these features directly into ChatGPT in the future. (…) Getting answers on the web can take a lot of effort, often requiring multiple attempts to get relevant results. We believe that by enhancing the conversational capabilities of our models with real-time information from the web, finding what you’re looking for can be faster and easier.” 1. obĂ©ir Ă  robots.txt OAI-Search passe sur robots.txt. OAI-S annonce suivre les recommandations de ce fichier, dans un dĂ©lai de 24h. Full user-agent string: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot OAI Search passe sur la plupart des fichiers robots.txt des sites suivis par Botscorner, avant de crawler. Il passe peu sur ce fichier: 12 demandes de fichiers robots.txt, sur pluei 2. Stats sur Botscorner. Les stats de OAI-Search, dont la version beta a Ă©tĂ© officiellement lancĂ©e fin juillet, commencent Ă  apparaitre sur Botscorner, avec quelques milliers de pages par jour, tous types d’éditeurs.  OAI-S fait encore quelques rĂ©glages sur son crawl, on observe de nombreux refus d’accès Ă  la page Ă  cause de la mĂ©thode de crawl, qui se rĂ©sorbent au fil du temps. en cette première semaine d’aoĂ»t 2024, on ne voit pas encore de mention « disallow » Ă  destination du user agent d’OAI Search. [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°08 – You.com
Le Botservatoire , le bulletin des crawlers commerciaux, n°08 – You.com31 octobre 2023Portrait Robot de You.com , un moteur de rĂ©ponses et de crĂ©ation de contenus. YOU.COM: « immediate answers, no more scrolling through a list of blue links” Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print. Ils opèrent pour les activitĂ©s de veille, des analyses, des rĂ©sumĂ©s, fournissent le big data de qualitĂ© indispensable aux IA … You.com est un moteur de rĂ©ponses aussi simple dans sa prĂ©sentation que peut l’être Google : un logo et une barre de recherches. Le service a Ă©tĂ© créé en 2020 par l’ancien fondateur de MetaMind-IA, rachetĂ© par SalesForce. Il bĂ©nĂ©ficie d’une levĂ©e de fonds de 45M$, ses revenus sont actuellement estimĂ©s Ă  15M$/an. Modèle Ă©conomique : Le service qui propose un “Chat GPT-4” service est gratuit dans une version de base non personnalisĂ©e, et devient payant (9,99$/mois) dès que l’on veut des rĂ©ponses plus Ă©laborĂ©es, ou crĂ©er des images, des rĂ©sumĂ©s,… Comme Google, il propose aux annonceurs des espaces publicitaires, sous forme d’annonces privĂ©es comportement -obĂ©ir Ă  robots.txt : You.com passe sur robots.txt, mais ce service utilisant ChatGPT peut passer sur des sites qui ont interdit GPTbot. –Un exemple de recherches :L’éditeur peut constater les modalitĂ©s d’emprunts de ses textes par ce moteur de rĂ©ponses, en comparant l’article créé Ă  partir d’un de ses articles scrapĂ©s. Exemple sur une recherche Ă  partir du contenu d’un article de niche, sur lequel il y aura peu de contenus d’agence ou de confrères: Article originel https://www.leparisien.fr/paris-75/monoprix-ouvre-son-premier-magasin-de-decoration-a-paris-12-07-2023-S4R3WCCWNZCLZILLSB6XOUZH3Y.php question: Monoprix ouvre un magasin deco design ? La rĂ©ponse de You.com Stats sur Botscorner Les stats de you.com commencent Ă  se remarquer, avec quelques milliers de pages par jour sur les sites branchĂ©s sur le service. [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°07 – Ubermetrics Unicepta
Le Botservatoire , le bulletin des crawlers commerciaux, n°07 – Ubermetrics Unicepta21 septembre 2023Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs radio, TV, presse online & print.une catĂ©gorie intermĂ©diaire de bots, , plus discrète, mais qui crawle massivement les sites : les bots commerciaux . ils opèrent pour les activitĂ©s de veille, permettent d’élaborer des stats, des analyses, des rĂ©sumĂ©s, fournissent les IA, revendent les bases Ă  des tiers… Portrait Robot de Ubermetrics , filiale d’Unicepta, une sociĂ©tĂ© de mediamonitoring . Ubermetrics propose un service de monitoring d’informations collectĂ©es mondialement sur les sites de presse : Ubermetrics is the leading Content Intelligence platform for communication experts. Its AI-driven media monitoring and analytics technology processes over 50,000 articles per minute from over 460 million global sources across all media types (print, online, social, TV & Radio). https://www.adwired.ch/company/partner/ Le service s’adresse aux entreprises. plus de 550 clients font confiance Ă  notre expertise et Ă  nos solutions. Parmi eux, on compte deux tiers des entreprises du DAX-40, des grands noms du CAC-40 et du SBF 120, ainsi que de nombreuses autres entreprises multinationales  https://www.unicepta.com/fr/a-propos-dunicepta/societe.html Clients : Airbus, Adidas, Bayer, Bosch, BMW, BritishAirways, Fifa, Mercedes, Stellantis, Lenovo, Tiktok, Virgin, Siemens… IA Comme beaucoup d’acteurs du mediamonitoring dĂ©sormais, Unicepta annonce un service de curation de contenus augmentĂ© d’IA : «  Grâce Ă  une technologie d’exploration alimentĂ©e par l’IA, UNICEPTA capture le contenu pertinent de 460 millions de sources mĂ©diatiques, partout dans le monde : Agences de Presse, presse Ă©crite, presse en ligne, mĂ©dias audiovisuels et sociaux, mĂ©dias nationaux, locaux ou rĂ©gionaux, mais aussi des publications plus confidentielles ou grand public. » Fourniture de rĂ©sumĂ©s « de haute qualitĂ© Ă©ditoriale vous offrant l’essentiel en un coup d’Ĺ“il. Vos informations qui comptent, reprises dans un format concis. Nos rĂ©sumĂ©s Ă©ditoriaux multilingues et cross-mĂ©dia sont compilĂ©s et rĂ©digĂ©s par des rĂ©dacteurs seniors expĂ©rimentĂ©s, issus d’Ă©quipes spĂ©cialisĂ©es dans votre secteur d’activité ». Des projets en cours : “We have been closely involved in the AI research landscape since 2011 – as a participant in expert discussions with the BMWi and BMBF as well as with the Federal Chancellor, as a member of the German AI Association” Les projets aboutis : qurator.ai , evalitech , Plass obĂ©ir Ă  robots.txt n’est pas une option qui semble avoir Ă©tĂ© retenue par Ubermetrics. Sur Botscorner, on le voit bien passer sur cette page Robots.txt publiĂ©e Ă  la racine des sites des Ă©diteurs de presse, et dĂ©diĂ©e Ă  la gestion des bots. Mais son scraper passe sur les articles malgrĂ© un refus sur « ubermetric » chez un Ă©diteur. Unicepta, c’est aussi Adwired « Adwired AG – the specialist for media and brand analysis – enters into a distribution partnership with Dow Jones / Factiva. As a Dow Jones reseller, Adwired may license approximately 5,000 international Paywall-protected media sources directly to its customers” Stats sur Botscorner. Les stats de Ubermetrics sur les sites de presse branchĂ©s sur le service sont impressionnantes : jusqu’à 500 000 requĂŞtes sur 24 heures. [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°06 – Les sites qui copient
Le Botservatoire , le bulletin des crawlers commerciaux, n°06 – Les sites qui copient12 septembre 2023L’info, c’est l’éditeur qui la produit, c’est le bot qui la publie ! voir les prĂ©cĂ©dents Botservatoires Les bots ne se contentent pas de constituer des bases pour les revendre aux IA ni de les structurer en offres, notamment de media monitoring. On assiste dĂ©sormais Ă  la crĂ©ation de nombreux sites d’infos dont les contenus sont rĂ©digĂ©s Ă  partir des articles de presse collectĂ©s en ligne. Les bots commencent gĂ©nĂ©ralement par indexer (crawler) les infos de crĂ©ation ou de mise Ă  jour des articles ou photos (sitemap, RSS, tĂŞtes de rubriques), puis vont chercher (scraper) les articles qui les intĂ©ressent. Pour cette activitĂ©, les bots prennent beaucoup moins d’articles que les entreprises de big data ou de media monitoring qui en rĂ©cupèrent des milliers par jour. Pour de la republication, quelques articles par jour et par Ă©diteur suffisent pour faire vivre un site de news. Le modèle Ă©conomique est gĂ©nĂ©ralement la publicitĂ©. S’il est rare de les voir remonter sur Google, certains de ces sites proposent de s’abonner Ă  leur newsletter ou Ă  leur fils Telegram, sur lesquels ils communiquent sur leurs articles. Si l’article complet est disponible sur le site originel, il sera publiĂ© en entier (avec un lien vers la source, devenu inutile). Par exemple : Article d’origine : Article identique, mais complet, republiĂ© sur un autre site: La nouveautĂ© ? L’ l’IA facilite de nombreux services parmi lesquels le rĂ©sumĂ©, la revue de presse citant un ou plusieurs articles, la traduction Ă  la volĂ©e qui permet avec un seul article d’en publier plusieurs dans toutes les langues… Le Figaro : Et son Ă©quivalent, qui correspond au rĂ©sultat donnĂ© par un service en ligne de traduction automatique : On peut mĂŞme ĂŞtre gratifiĂ© d’un avertissement, qui explique la dĂ©marche. Près d’une reprise d’un article, on peut lire : AVIS IMPORTANT Tous les articles sont traduits de la source originale. Nous exploitons un service de traduction pour aider les anglophones en France Ă  comprendre ce qui se passe dans toute la France. Tout le contenu et les photos sont la propriĂ©tĂ© de la source originale. Chaque article a un lien vers la source originale au bas de l’article. Nous ne stockons aucune image de la source d’origine sur notre serveur (…) Si vous souhaitez qu’un Ă©lĂ©ment soit supprimĂ©, vous pouvez nous contacter avec l’URL et la preuve des droits de propriĂ©tĂ© pour supprimer tout Ă©lĂ©ment de notre système. Evidemment, le site n’a pas de directeur de publication, et la page contact n’existe pas. Ces sites de « news Â» ont gĂ©nĂ©ralement des maquettes assez sommaires, avec de nombreuses rubriques (alimenter toutes ces rubriques nĂ©cessiterait une vraie rĂ©daction, qui semble assez absente). Nous remontons sur Botscorner une soixantaine de sites qui publient des articles rĂ©cupĂ©rĂ©s sur les sites de news. Attention : Ă  ne pas mettre l’intĂ©gralitĂ© d’un article dans le flux RSS , Ă  ne pas rendre disponible un article par le code source quand il est soumis Ă  un paywall. [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°05 – Semrush-Prowly
Le Botservatoire , le bulletin des crawlers commerciaux, n°05 – Semrush-Prowly16 juin 2023Comment une sociĂ©tĂ© spĂ©cialisĂ©e en SEO peut-elle Ă©tendre ses services Ă  ses nombreux clients : les donnĂ©es collectĂ©es sur le net pourraient-elles s’étendre Ă  d’autres usages ? Dans le prĂ©cĂ©dent Botservatoire, on a vu que des sociĂ©tĂ©s Ă  but non lucratif pouvaient nourrir gracieusement des IA avec les donnĂ©es des Ă©diteurs de presse (CommonCrawl.org pour OpenAI-ChatGPT). Portrait Robot de : Semrush.com et de sa filiale Prowly.com SEMrush, donnĂ©es financières : CA 170,7M$ , valorisation de la sociĂ©tĂ© 2,4B$ (source:growjo.com) Un service de Search Engine Optimization permet de suivre le positionnement de son site sur le web. Semrush met en avant un service très performant. Il crawle votre site et les sites concurrents. Il vous indique alors ce que vos concurrents font mieux que vous, et surtout comment amĂ©liorer votre classement par rapport Ă  eux. Semrush a vite augmentĂ© son offre de services : plateforme agence relations Publiques , analyse des interactions sur les rĂ©seaux sociaux , des publicitĂ©s Display des concurrents , mais aussi : agence de crĂ©ation de contenus , et Media Monitoring (suivi des mentions presse) La crĂ©ation d’articles, quel que soit le sujet, est Ă©videmment garantie optimisĂ©e pour les moteurs de recherches. Des options permettent de reformuler un texte copiĂ© pour Ă©viter le plagiat , en comparant dans une base de textes. Et une IA  peut mĂŞme gĂ©nĂ©rer des textes. Enfin, le service de media monitoring est assurĂ© par une sociĂ©tĂ© achetĂ©e en 2020 par Semrush : Prowly. Pour un prix annoncĂ© infĂ©rieur Ă  ceux de Cision ou Meltwater, Prowly remontera les mentions trouvĂ©es dans la presse Avis : On comprend bien l’intĂ©rĂŞt du client de Semrush de le laisser crawler son propre site, on comprend moins bien celui du site concurrent, s’il n’est pas lui-mĂŞme client de Semrush. En effet, il va donner gratuitement des informations qui permettront Ă  ses rivaux de lui passer devant sur Google. Quelques Ă©diteurs ont d’ailleurs dĂ©cidĂ© de bloquer le crawl de sociĂ©tĂ©s offrant ce type de services, en attendant qu’une licence couvrant l’utilisation de leurs contenus soit signĂ©e. Le crawler de Semrush collecte des datas en permanence, jusqu’à 240 000 requĂŞtes par jour, visibles sur les sites branchĂ©s sur le service. On en compte 20 000 de plus sur un crawl attribuĂ© Ă  Prowly, qui ne met pas de user agent Ă©ponyme. statistiques du bot Semrush sur des sites de presse Français [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°04 – CommonCrawl
Le Botservatoire , le bulletin des crawlers commerciaux, n°04 – CommonCrawl7 juin 2023L’industrie du big data vend les articles de presse, ou les donnĂ©es extraites de ces articles, Ă  zĂ©ro euro. Cela signifie-t-il qu’il n’y a pas de modèle Ă©conomique sur ce marchĂ© pour un site de presse ?Dans le prĂ©cĂ©dent Botservatoire on a vu que des sociĂ©tĂ©s commerciales proposent leurs services Ă  un prix très bas. Chez Webzio, l’article est Ă  0,0002€, ce qui laisse imaginer la part rĂ©servĂ©e au droit d’auteur. Comment construire un modèle Ă©conomique ? En demandant Ă  ces sociĂ©tĂ©s commerciales de tenir compte, dans leur tarification, de la rĂ©munĂ©ration des Ă©lĂ©ments extraits des sites de presse. Aujourd’hui, ces services ne facturent que leur technologie. Mais sans les Ă©lĂ©ments extraits des sites de presse et relevant du droit d’auteur, il n’y aurait pas de service.Mais le big data encore moins cher existe ! Portrait Robot de CommonCrawl.org Des sociĂ©tĂ©s Ă  but non lucratif crawlent Ă©galement les sites de presse.CommonCrawl est un service gratuit mettant Ă  disposition sept annĂ©es d’archives. Les donnĂ©es sont disponibles gratuitement pour la recherche, et payĂ©es au bon vouloir des utilisateurs, par des donations. CommonCrawl propose un accès aux archives, dans plus de 40 langues.  Cela permet aux chercheurs du public, comme du privĂ©, d’entraĂ®ner leurs IA. CommonCrawl est une organisation Ă  but non lucratif. A ce titre, une sociĂ©tĂ© qui souhaite utiliser des articles de presse pour entraĂ®ner une IA, peut travailler sur les bases offertes et financer l’activitĂ© de CC.org en bĂ©nĂ©ficiant de rĂ©ductions d’impĂ´ts. Ainsi, Meta pour son IA appelĂ©e LLaMA, ou OpenAI pour ChatGPT, ont pu, comme des centaines d’autres, utiliser ces donnĂ©es disponibles issues de CC.org ou Wikipedia : Source :  medium.com Ainsi, un crawl gratuit sans modèle Ă©conomique peut gĂ©nĂ©rer des services commerciaux très rentables. ChatGPT a dĂ©sormais un investisseur de choix avec Microsoft, et se trouve incorporĂ© Ă  la recherche Bing avec une version amĂ©liorĂ©e. Le crawler de CommonCrawl collecte des datas en permanence, et Ă  plus forte dose une semaine par mois (entre 5000 et 25000 requĂŞtes par jour).En effet, l’offre de CC.org consiste Ă  proposer une base d’articles permettant d’agrĂ©ger des connaissances pour des IA. Cela diffère des offres big data utilisĂ©es par des sociĂ©tĂ©s de media monitoring et e-rĂ©putation, qui crawlent plus massivement car elles ont besoin des dernières informations dès leur publication. [...]Lire la suite…
Le Botservatoire , le bulletin des crawlers commerciaux, n°03 – Webzio
Le Botservatoire , le bulletin des crawlers commerciaux, n°03 – Webzio11 mai 2023Par BotsCorner.com Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs de presse. Une catĂ©gorie de bots crawle massivement, mais discrètement, les sites : les bots commerciaux. Ils opèrent pour les activitĂ©s de veille, permettent d’élaborer des stats, des analyses, des rĂ©sumĂ©s. Ils fournissent en contenus les IA, revendent les bases Ă  des tiers… Portrait-robot de Webz.io , sociĂ©tĂ© de collecte et revente Big data Webz.io propose un service de collecte et de mise en forme de donnĂ©es rĂ©coltĂ©es sur le web.Tous les sites d’informations les plus pertinents sont crawlĂ©s, Webz.io dĂ©clare collecter 2,5 millions d’articles chaque jour sur 180 000 sites d’informations. Ce crawl permanent permet de fournir des rĂ©sultats en quasi temps rĂ©el. De plus, Webz.io propose un accès aux archives depuis 2008. CA estimĂ©: 4M$ 1. Les clients du service : Webz.io annonce travailler pour SalesForce, IBM, Datarobot , Sprinklr, Kantar , Brandwatch, Meltwater , Mention … 2. Le bot passe sur le fichier « robots.txt » mis en place par les Ă©diteurs, mais ne semble pas en respecter toutes les interdictions mentionnĂ©es (l’observation de ces instructions n’est pas obligatoire). 3. La valeur : A notre connaissance, Webz.io n’envisage pas d’intĂ©grer les droits d’auteur dans ses formules tarifaires. Les tarifs ne sont pas publics, mais selon cette page c’est en moyenne 200€/mois pour un crawl assez massif. Les datas archives sont chiffrĂ©es en fonction de l’abonnement du client Ă  Webz.io. Le premier prix, très attractif, est de 0.0002€ par article. 4. La recommandation : en l’absence d’accord, bloquer. Ce scraping ne gĂ©nère pas de visites : il peut mĂŞme concurrencer des infomĂ©diaires ayant signĂ© des accords pour rĂ©munĂ©rer les Ă©diteurs. De surcroĂ®t, le tarif très bas de ce service institue les sites d’informations comme sources de matière première gratuite. 5. Stats sur Botscorner. Les stats de Webz.io sur les sites d’informations branchĂ©s sur le service proposĂ© par le CFC montrent jusqu’à 130 000 requĂŞtes en 24 heures. Statistiques passage webz.io sur le service Botscorner [...]Lire la suite…
<strong>Le Botservatoire , le bulletin des crawlers commerciaux, n°02 – Gnowit</strong>
Le Botservatoire , le bulletin des crawlers commerciaux, n°02 – Gnowit4 mai 2023Par BotsCorner.comTous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs de presse. Une catĂ©gorie de bots crawle massivement, mais discrètement, les sites : les bots commerciaux. Ils opèrent pour les activitĂ©s de veille, permettent d’élaborer des stats, des analyses, des rĂ©sumĂ©s. Ils fournissent en contenus les IA, revendent les bases Ă  des tiers… Portrait-Robot de GNOWIT.COM , sociĂ©tĂ© de media monitoring. Gnowit propose un service d’alerte et d’analyses Ă  partir de donnĂ©es crawlĂ©es sur plus de deux millions de sources (des sites de presse et des sites institutionnels), pour des prix allant de 200 Ă  2000 $Can par mois. CA estimĂ©: moins de 2M$ (estimation growjo.com) Le service s’adresse aux entreprises et aux administrations… Gnowit « capture » les informations dans les quinze minutes qui suivent leur publication, et propose Ă  ses clients B2B d’effectuer des recherches sur le « full-text » L’option : la sĂ©lection d’articles par des humains. Ce service peut inclure du contenu derrière le paywall, du contenu de niche ou « difficile d’accès ». (https://www.gnowit.com/pricing/ rubrique « add-ons available »).Compter 1000$Can/mois en plus pour 5 thĂ©matiques. 3. Le crawl avec user-agent Gnowit provient de dizaines d’hĂ©bergeurs, de centaines d’IPs qui changent rĂ©gulièrement. Cela oblige l’éditeur Ă  un suivi contraignant, s’il Ă©tait tentĂ© par un blocage des tĂ©lĂ©chargements de ses donnĂ©es. Par ailleurs, sur les Ă©diteurs installĂ©s sur nos services, le bot Gnowit ne passe pas sur le fichier « robots.txt » (robots.txt indique aux bots si leur crawl est autorisĂ© sur tout ou partie du site). La valeur : A notre connaissance, Gnowit ne demande pas d’autorisation avant de faire passer ses robots sur les sites de presse, et n’envisage pas d’intĂ©grer les droits d’auteur dans ses formules tarifaires.FAQ de Gnowit: pour rester en accord avec les lois sur le copyright, Gnowit dĂ©livre le lien vers le document original, avec un extrait du texte. Mais les recherches se font sur le texte entier, hĂ©bergĂ© chez Gnowit. Gnowit propose l’export du « full text » pour l’abonnement « Entreprise » dans le cadre d’un contrat qui assure le client que l’usage entre dans le cadre des exceptions prĂ©vues dans les lois de la plupart des juridictions concernĂ©es. FAQ Gnowit La recommandation : en l’absence d’accord, bloquer.Les infomĂ©diaires abonnent des clients B2B Ă  des contenus issus de sources de presse, ce qui nĂ©cessite un accord prĂ©alable. Nombre d’entre eux ont dĂ©jĂ  signĂ©, en direct ou par l’intermĂ©diaire de leurs mandataires, des accords encadrant des utilisations identiques. Stats sur Botscorner.Les stats de Gnowit sur les sites d’informations branchĂ©s sur le service proposĂ© par le CFC vont jusqu’à 110 000 requĂŞtes par jour. La semaine prochaine… Webzio Statistiques passage Gnowit sur le service Botscorner.com [...]Lire la suite…
Le Botservatoire, une newsletter des crawlers commerciaux – n01 Diffbot
Le Botservatoire, une newsletter des crawlers commerciaux – n01 Diffbot4 mai 2023Par BotsCorner.com Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs de presse. Tous les jours, des centaines de crawlers collectent des donnĂ©es sur les sites des Ă©diteurs de presse. Certains bots sont des partenaires des Ă©diteurs (Googlebot, Bingbot, publicité…) , d’autres attaquent les sites (ddos, spam, …) et nĂ©cessitent un blocage immĂ©diat. Il reste une catĂ©gorie intermĂ©diaire, plus discrète, mais qui crawle massivement les sites : les bots commerciaux . ils opèrent pour les opĂ©rateurs d’activitĂ©s de veille, ils permettent d’élaborer des statistiques, des analyses, des rĂ©sumĂ©s, fournissent les IA, revendent « leurs » bases Ă  des tiers… Analyse d’aujourd’hui : DIFFBOT.COM , un grossiste data. Diffbot propose un service de big data, crawlĂ©s (indexĂ©s) et scrapĂ©s (tĂ©lĂ©chargĂ©s) Ă  des prix dĂ©fiant toute concurrence. 1. Le service s’adresse aux entreprises, prestataires de panoramas, analystes, statisticiens.. Diffbot annonce travailler pour Meltwater, Cision, Factset, Dowjones, …cela consiste en un tĂ©lĂ©chargement de donnĂ©es de sites diffĂ©rents, qui ont donc des structures diffĂ©rentes, pour constituer une base d’articles structurĂ©e exploitable. 2. Le tĂ©lĂ©chargement est quotidien et massif, mais il est effectuĂ© sous les radars, donc sans blocage : –obĂ©ir Ă  robots.txt est en option dans une case Ă  cocher , Diffbot propose Ă  ses clients de choisir de se conformer, ou pas, au fichier robots.txt -il propose des proxies, des IPs jetables qui permettent de diluer et invisibiliser un crawl massif : « No More Blocked Crawls. Utilize our reserved fleet of proxy IPs, optionally upgrade to gain access to tens of thousands of unique IPs for truly diversified crawling or region/country-specific extraction”. -il propose Ă©galement de crawler « derrière le login » vidĂ©os en ligne dĂ©taillant les offres Diffbot 3. les donnĂ©es prĂ©levĂ©es sur un site de presse sont donc revendues Ă  la page, sans nĂ©cessiter l’accord prĂ©alable de l’éditeur, ni tenir compte des droits d’auteur: Ă  $0.0009/page! Le modèle Ă©conomique de Diffbot n’intègre pas de rĂ©trocession pour les ayants droit “The number of credits you need will depend on your use case and volume. Extracting a single web page will use 1 credit, so scraping 100,000 pages monthly will require 100,000 credits per month. (..) if you use 1,500,000 credits in a month on the Plus plan, your billed amount that month will be $899 (Plan Base) + 500,000 x $0.0009/credit”. 4. recommandation: bloquer tant qu’il n’y a pas d’accord. Les bots qui font du big data ont un impact sur le modèle Ă©conomique des Ă©diteurs et de leurs mandataires. En fournissant Ă  prix très bas des grands volumes de contenus Ă  de nombreux tiers pour toutes exploitations, ils facilitent l’utilisation massive des contenus des sites sans contrepartie ni autorisation. 5. stats sur Botscorner. Les stats de Diffbot sur les journaux branchĂ©s sur le service ORRC proposĂ© par le CFC sont massives : jusqu’à 1 800 000 requĂŞtes sur 24h . Statistiques passage Diffbot sur le service Botscorner.com La semaine prochaine : webzio [...]Lire la suite…