# llms.txt — Policy per Large Language Models (LLM) # Sito: https://egomnia.com # Proprietario: Egomnia S.p.A. # Ultimo aggiornamento: 2025-11-03 # Versione policy: 1.0 # Obiettivo # Questo file definisce regole chiare su come agenti AI/LLM possono accedere, utilizzare e riutilizzare i contenuti del sito. # Le presenti condizioni integrano e non sostituiscono i Termini, la Privacy e il Copyright indicati nel footer e nei domini collegati. [meta] site = https://egomnia.com owner = Egomnia S.p.A. contact = https://egomnia.com/ ; Per richieste formali indicare: "Ufficio Legale" languages = it, en, es source-of-truth-language = it [defaults] # Regole di base applicate a TUTTI gli agenti AI/LLM se non diversamente specificato nella sezione [agents]. crawling = allow ; è consentito il crawling per anteprime e snippet indexing = allow ; è consentita l'indicizzazione dei soli URL training = disallow ; vietato usare i contenuti per addestrare modelli o dataset fine_tuning = disallow embedding_corpus_build = disallow # Permessi di utilizzo (solo inferenza/preview) # - Riepiloghi o snippet fino a 200 caratteri per pagina sono consentiti se accompagnati da link canonico. # - È sempre richiesta attribuzione chiara a "Egomnia S.p.A." con URL sorgente. # - È vietata la memorizzazione duratura di contenuti per scopi diversi dalla generazione istantanea richiesta dall'utente. [usage] attribution = required snippet_max_chars = 200 link_back = required store_content = ephemeral_only ; consentita cache effimera massimo 7 giorni per quality checks retention_days = 7 pii_storage = disallow ugc_treatment = copyrighted_by_publisher [rate_limits] rps = 1 ; richieste al secondo rpm = 30 ; richieste al minuto burst = 10 ; connessioni concorrenti massime crawl_window = 08:00-22:00 Europe/Rome [paths] # Consentito leggere le pagine pubbliche; vietato usare asset e directory tecniche per dataset/training. allow = / allow = /index.html allow = /index_en.html allow = /index_es.html allow = /sitemap.xml allow = /sitemap-images.xml # Cartelle da NON utilizzare per training/dataset e da non scaricare in bulk (salvo necessità di rendering puntuale) disallow = /js/ disallow = /css/ disallow = /images/ disallow = /fonts/ disallow = /logs/ disallow = /server/ # Eccezioni: il fetch puntuale di singoli asset per generare un'anteprima è consentito, ma NON può # essere usato per addestramento, set di embedding o ricostruzione bulk dei contenuti del sito. assets_fetch_for_preview_only = true [agents] # Regole specifiche per alcuni crawler/LLM noti (case-insensitive sullo User-Agent). # Se un agente non è elencato, si applicano le regole [defaults]. # OpenAI "GPTBot".crawling = allow "GPTBot".training = disallow "ChatGPT-User".crawling = allow "ChatGPT-User".training = disallow # Google "Google-Extended".training = disallow "GoogleOther".crawling = allow "GoogleOther".training = disallow # Anthropic "ClaudeBot".crawling = allow "ClaudeBot".training = disallow "Claude-Web".crawling = allow "Claude-Web".training = disallow # Perplexity "PerplexityBot".crawling = allow "PerplexityBot".training = disallow # Amazon "Amazonbot".crawling = allow "Amazonbot".training = disallow # Apple "Applebot-Extended".training = disallow # ByteDance "Bytespider".crawling = disallow "Bytespider".training = disallow # Meta "FacebookBot".crawling = allow ; anteprime social "FacebookBot".training = disallow "Meta-ExternalAgent".crawling = disallow "Meta-ExternalAgent".training = disallow # Common Crawl "CCBot".crawling = disallow "CCBot".training = disallow # Altri agenti noti "YouBot".crawling = allow "YouBot".training = disallow "cohere-ai".crawling = disallow "cohere-ai".training = disallow [compliance] # Esecuzione e vincoli legali policy_is_binding = true legal_basis = EU Copyright Directive, Italian Copyright Law, Terms & Privacy indicati nel footer redistribution = disallow_without_written_consent model_weight_training_on_content = prohibited moderation_or_research_exceptions = contact_owner_for_written_permission [discovery] # Percorsi utili agli agenti per una scansione corretta e rispettosa. sitemap = https://egomnia.com/sitemap.xml canonical = https://egomnia.com/ [notes] # 1) Questa policy non modifica robots.txt, ma lo integra con istruzioni specifiche per usage e training. # 2) Gli agenti che non rispettano llms.txt e riutilizzano i contenuti per training saranno in violazione dei nostri termini. # 3) Aggiorneremo questa pagina se future specifiche standard (es. ai.txt/llm.txt) dovessero emergere. # English summary (non-normative) # Crawling for previews/snippets is allowed with attribution; AI training/fine-tuning/embedding-corpus building is disallowed. # Respect rate limits (1 rps, 30 rpm) and avoid bulk asset collection. Ephemeral cache up to 7 days only. # For exceptions or research use, request written permission from the site owner.