# larsanderson.com — Lars Anderson # # Persoonlijke site van Lars Anderson, Manager Innovatie bij DPG Media, # spreker, AI-trainer en host van de Media Innovatie Podcast. Alles hier # gaat over de toekomst van de journalistiek en de rol van AI daarin. # # /podcast/ Media Innovatie Podcast — maandelijks, met co-host # Philippe Remarque. Zeventien afleveringen, van GPT-NL # tot het scrapendebat. # /chat/ een assistent die vragen over de afleveringen # beantwoordt en bij elk antwoord de aflevering noemt # waar het vandaan komt # /ai-training/ keynotes en workshops prompt engineering voor redacties # en organisaties # /media/ interviews, artikelen en optredens elders # /about/ achtergrond en contact # # Alle rechten voorbehouden onder artikel 4 van de EU-auteursrechtrichtlijn # 2019/790 en artikel 15o Auteurswet. Het machinaal leesbare voorbehoud # staat in /.well-known/tdmrep.json. # # ── WAAROM DIT BESTAND IS ZOALS HET IS ─────────────────────────── # # Dit is geen nieuwssite. Er zit geen betaalmuur omheen en het werk moet # juist gevonden worden: door redacties, door wie een spreker of training # zoekt, door wie het onderwerp onderzoekt. # # Daarom is de afweging hier anders dan bij een uitgever. Trainings- en # doorverkoopcrawlers zijn geweerd: die nemen de tekst mee en sturen nooit # iemand terug. AI-zoekmachines, live-ophalers en agents staan er # uitdrukkelijk NIET in, en dat is een keuze en geen omissie. Wie gevonden # wil worden, moet vindbaar zijn — ook in een AI-antwoord. # # Crawlerlijst bijgehouden via github.com/ai-robots-txt/ai.robots.txt # ── TRAINING · 40 crawlers ────────────────────────────── # Je tekst gaat permanent een model in en er komt geen lezer terug. User-agent: AI2Bot User-agent: Ai2Bot-Dolma User-agent: anthropic-ai User-agent: Applebot-Extended User-agent: Brightbot User-agent: Brightbot 1.0 User-agent: Bytespider User-agent: CCBot User-agent: ChatGLM-Spider User-agent: ClaudeBot User-agent: CloudVertexBot User-agent: cohere-training-data-crawler User-agent: Cotoyogi User-agent: DeepSeekBot User-agent: ERNIEBot User-agent: FacebookBot User-agent: Factset_spyderbot User-agent: FriendlyCrawler User-agent: Google-CloudVertexBot User-agent: Google-Extended User-agent: GPTBot User-agent: ICC-Crawler User-agent: img2dataset User-agent: ISSCyberRiskCrawler User-agent: Kangaroo Bot User-agent: KimiBot User-agent: laion-huggingface-processor User-agent: LAIONDownloader User-agent: Linguee Bot User-agent: Meta-ExternalAgent User-agent: MistralAI-Training User-agent: PanguBot User-agent: QwenBot User-agent: Reflectionbot User-agent: SBIntuitionsBot User-agent: Sidetrade indexer bot User-agent: TikTokSpider User-agent: Timpibot User-agent: YandexAdditional User-agent: YandexAdditionalBot Disallow: / # ── DOORVERKOOP · 32 crawlers ────────────────────────────── # Datahandel. Hier valt niets af te wegen. User-agent: aiHitBot User-agent: ApifyBot User-agent: ApifyWebsiteContentCrawler User-agent: Awario User-agent: bigsur.ai User-agent: CragCrawler User-agent: Crawl4AI User-agent: Crawlspace User-agent: Datenbank Crawler User-agent: Diffbot User-agent: Echobot Bot User-agent: FirecrawlAgent User-agent: ImagesiftBot User-agent: imageSpider User-agent: LCC User-agent: MyCentralAIScraperBot User-agent: netEstate Imprint Crawler User-agent: newsai User-agent: omgili User-agent: omgilibot User-agent: Panscient User-agent: panscient.com User-agent: Poseidon Research Crawler User-agent: Scrapy User-agent: SemrushBot-OCOB User-agent: SemrushBot-SWA User-agent: Spider User-agent: Thinkbot User-agent: VelenPublicWebCrawler User-agent: WARDBot User-agent: Webzio-Extended User-agent: YaK Disallow: / # ── DOEL ONBEKEND · 2 crawlers ────────────────────────────── # Niet gedocumenteerd wat er met de content gebeurt. # Geen documentatie betekent geen toestemming. User-agent: Aranet-SearchBot User-agent: KunatoCrawler Disallow: / # ── UITDRUKKELIJK WEL TOEGESTAAN ───────────────────────────── # Deze staan hierboven bewust niet, en dat is een keuze, geen omissie: # # AI-ZOEKEN / INDEX 37 crawlers # LIVE-OPHALERS 33 crawlers # AGENTIC 19 crawlers # # Ze mogen deze site lezen, citeren en ernaar verwijzen. Zoekmachines # en linkvoorbeeld-crawlers evenmin geblokkeerd. User-agent: * Allow: / Sitemap: https://larsanderson.com/sitemap-index.xml