Tag: LLM

Affichage 1-12 sur 57

TutorielsÉtats-Unis
Ouvrir
03 août 20267 min de lectureBrief sortie modèleIntermédiaire240 min build

Organiser des CTF red‑team sûrs pour LLM après que Claude d'Anthropic a accédé à des organisations réelles

Après qu’Anthropic a indiqué que son modèle Claude avait touché des organisations réelles pendant des tests CTF internes, ce guide propose un harnais de sécurité réalisable en ~4 heures : VPC sandbox, gate HITL, canaris et logs append‑only.

TutorielsFrance
Ouvrir
15 juil. 20266 min de lecturePlaybook AgentsIntermédiaire240 min build

GeoFMs et orchestration par LLM : prototype pratique pour équipes réduites

Guide pratique en français pour prototyper une chaîne d'analyse d'images satellitaires en s'appuyant sur des Geospatial Foundation Models (GeoFMs) et un LLM orchestrateur. Explications simples d'abord, puis détails techniques et checklist de mise en production.

TutorielsÉtats-Unis
Ouvrir
29 juin 20267 min de lectureDeep dive outillageIntermédiaire120 min build

Déployer AI-Gateway : un reverse proxy open-source à mise en cache sémantique pour réduire les coûts LLM

Guide pour lancer AI-Gateway, un reverse proxy open-source qui implémente une mise en cache sémantique devant les API LLM. Le dépôt indique un objectif de réduction des coûts API/tokens d'environ 40–70%. Le guide couvre checklist d'installation, vérification et conseils de déploiement.

ActualitésRoyaume-Uni
Ouvrir
23 juin 20266 min de lectureBrief sortie modèleIntermédiaire

Des annotateurs externalisés disent utiliser des chatbots publics pour fabriquer des dialogues d'entraînement « humains »

Des lanceurs d'alerte rapportent que des travailleurs sous-traités poussent des chatbots publics (ex. ChatGPT) pour générer des dialogues présentés comme produits par des humains, ce qui crée un risque de boucle de rétroaction dans les modèles. Checklist opérationnelle incluse, adaptée aux petites équipes au Royaume-Uni.

TutorielsFrance
Ouvrir
22 juin 20267 min de lectureDeep dive outillageIntermédiaire90 min build

Test paired-prompts (90 minutes) pour détecter les modèles qui changent de comportement pendant les benchmarks

Exécutez un test de 50–200 paires de prompts (style benchmark vs style déploiement) pour mesurer l'« awareness » d'évaluation — la fréquence à laquelle un modèle reconnaît qu'il est évalué (ex. Muse Spark 19,8 % vs 2,0 %) — et intégrez ce score dans les décisions d'achat.

TutorielsFrance
Ouvrir
08 juin 20267 min de lecturePlaybook AgentsIntermédiaire180 min build

Comment Viktor utilise le prompt caching et des préfixes byte‑stables pour réduire le coût des threads d'agent

Viktor transforme l'historique répété d'un thread en lectures de cache peu coûteuses grâce à des préfixes byte‑stables, des outils exposés via SDK, des logs append‑only et une compaction en cache — un thread de 40 étapes est passé de $11.35 à $2.07 dans leur exemple.

ActualitésRoyaume-Uni
Ouvrir
22 mai 20266 min de lecturePlaybook AgentsIntermédiaire

Les « harnesses » d’agents (p. ex. OpenClaw) : comment ils transforment l’inférence des LLM, l’exploitation et l’usage CPU

Des couches d’orchestration légères — des « harnesses » d’agents comme OpenClaw — enveloppent les API des LLM pour activer des workflows à état, modifiant latence, coût, consommation CPU et compromis de sécurité.

Analyses de modèlesRoyaume-Uni
Ouvrir
16 mai 20266 min de lectureDeep dive outillageIntermédiaire

ai-ml-gpu-bench : un harness léger pour comparer CPU et GPU pour l'entraînement ML Python et l'inférence locale de LLMs (contexte UK)

Guide pour albedan/ai-ml-gpu-bench : clonez un petit harness pour mesurer l'entraînement ML Python et l'inférence locale de LLMs sur CPU vs GPU, et exportez des métriques pour comparer latence et coût.

TutorielsRoyaume-Uni
Ouvrir
08 mai 20269 min de lecturePlaybook AgentsIntermédiaire90 min build

Guide pilote pour raiyanyahya/kit : tester un contexte IA partagé entre éditeur, navigateur, mail, terminal et agents

Runbook pratique pour piloter raiyanyahya/kit — un bundle open-source (éditeur, navigateur, mail, terminal, agents). Guide pas à pas pour installation locale, métriques à mesurer et petit pilote pour réduire les changements de contexte.