unslopf

Geef het markdown, URL's of een sitemap. Het profileert zinnen van 2 tot 4 woorden, filtert domeinnamen en grammaticolijm eruit, en geeft een korte lijst terug van zinnen die al te vaak voorkomen — een negative prompt zodat het volgende stuk niet klinkt als de laatste tien.

Eén URL per regel, tot 12. Een sitemap wordt uitgevouwen naar artikelpagina's. Alleen https.

Negative keywords

De lijst verschijnt hier.

Limieten: 12 URL's, 80000 tekens per document, 10 / 10 min per IP. Er wordt niets opgeslagen. Privé-hosts worden geweigerd.

Het eerlijke deel

Dit is frequentie, geen smaak. Een zin die bij het onderwerp hoort, scoort nog steeds als je hem niet op de keep-lijst zet. Banlijsten verouderen ook: na genoeg nieuwe woorden opnieuw genereren. Combineer de lijst met een structurele instructie, zodat het model "delve into" niet inwisselt voor "dive into".

API

POST JSON. Geef een sitemap, een lijst pagina-URL's, inline markdown, of een mix. De response is de gescoorde lijst plus een injecteerbare prompt.

curl -sS -X POST https://ninokroesen.nl/api/unslopf \
  -H 'Content-Type: application/json' \
  -d '{"sitemap":"https://ninokroesen.com/sitemap.xml"}'

Pagina's in plaats van een sitemap

curl -sS -X POST https://ninokroesen.nl/api/unslopf \
  -H 'Content-Type: application/json' \
  -d '{"urls":["https://example.com/post-one","https://example.com/post-two"]}'

Veelgestelde vragen

Wat doe ik met die lijst?

Zet hem als negative prompt in het system prompt, zodat het volgende stuk niet opnieuw leunt op de zinnen die de vorige tien al gebruikten. Het is een lijst zinnen die in de aangeleverde pagina's al te vaak voorkomen.

Hoe kiest het de zinnen?

Mechanisch: het telt n-grams van 2 tot 4 woorden, laat domeinwoorden en grammaticolijm vallen, en houdt over wat over documenten heen terugkomt. Er zit geen LLM in, dus dezelfde invoer geeft dezelfde lijst.

Kan ik het op mijn eigen site richten?

Ja, met een sitemap of een lijst pagina-URL's (alleen https en publieke hosts; privé-adressen worden geweigerd). Tot 12 URL's en 80000 tekens per document, 10 / 10 min per IP.

Bewaren jullie de opgehaalde pagina's?

Nee. Het haalt op, profileert en geeft terug; er gaat niets naar schijf of database.

Meer uit het lab

Alle experimenten