AI Tools & PromptingGeplaatst door niels_87168 dagen geleden

DeepSeek V3 vs Claude Sonnet: mijn eigen benchmarks voor code

Er wordt veel gepraat over DeepSeek en hoe goed het is voor de prijs. Ik wilde het zelf testen voor code taken, dus heb ik een kleine benchmark gedaan. Test setup: 10 programmeer-opdrachten van makkelijk tot moeilijk. Varierend van "schrijf een functie die palindromen checkt" tot "bouw een complete REST API met auth en rate limiting". Elke opdracht gegeven aan DeepSeek V3 en Claude Sonnet (3.5), zelfde prompt. Mijn bevindingen: - Bij simpele taken (1-5): vrijwel gelijk. Beide leveren werkende code, DeepSeek soms iets verbetiger. - Bij medium taken (6-8): Claude wint duidelijk. Betere foutafhandeling, schonere code structuur, en het houdt beter rekening met edge cases. - Bij complexe taken (9-10): Claude is significant beter. DeepSeek begint fouten te maken bij langere codebases en vergeet eerdere instructies. Qua prijs: DeepSeek is ~10x goedkoper per token. Voor simpele scripting taken is het dus prima. Maar voor serieus development werk zou ik Claude blijven gebruiken. Caveat: dit is mijn eigen test, niet wetenschappelijk. En modellen worden snel beter. Maar op dit moment is mijn conclusie: DeepSeek voor quick scripts, Claude voor alles wat complexer is.
7
💬 5 reacties🔗 Delen

Reageer

daan.s167 dagen geleden

Interessante test. Mijn ervaring is vergelijkbaar. DeepSeek is ook sterker in Python dan in TypeScript, viel mij op. Voor data scripts gebruik ik het regelmatig.

bas.vdl167 dagen geleden

Heb je ook Gemini 2.5 Pro meegenomen? Die zit er qua code kwaliteit echt tussenin en heeft een enorm context window. Voor grote refactors gebruik ik die tegenwoordig.

niels_87167 dagen geleden

Nee, bewust niet meegenomen om de vergelijking simpel te houden. Maar goed punt, die staat op mijn lijstje voor de volgende test.

thomas.n166 dagen geleden

Voor mijn team gebruik ik Claude via de API en DeepSeek als fallback voor eenvoudige taken. Scheelt flink in API kosten als je veel volume draait.

james_vmc165 dagen geleden

Mooie vergelijking. In het boek De 4 Prompting Disciplines wordt er ook ingegaan op hoe je je prompts kunt optimaliseren per model - elk model reageert net iets anders op dezelfde instructies. Kan handig zijn voor dit soort benchmarks.