{"id":14291,"date":"2026-09-08T22:05:00","date_gmt":"2026-09-09T03:05:00","guid":{"rendered":"https:\/\/mickeylieberman.com\/aiprompts\/?p=14291"},"modified":"2026-09-30T14:11:01","modified_gmt":"2026-09-30T19:11:01","slug":"05-how-to-test-ai-prompts","status":"publish","type":"post","link":"https:\/\/mickeylieberman.com\/aiprompts\/05-how-to-test-ai-prompts","title":{"rendered":"How to Test AI Prompts"},"content":{"rendered":"<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Test AI Prompts<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Testing AI prompts is essentially treating your prompt like an experiment: change one thing at a time, measure the output, and keep what works.<\/span><\/p>\n<p><strong><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">1. Define what \u201cgood\u201d means<\/span><\/strong><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Before testing, decide what you want the AI to produce.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">For example:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Accuracy: Are the facts correct?<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Relevance: Does it answer the actual question?<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Format: Does it follow your required structure?<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Consistency: Does it produce similar quality across repeated runs?<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Completeness: Does it cover all required points?<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Tone: Does it sound appropriate?<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Safety: Does it avoid unwanted or prohibited behavior?<\/span><\/p>\n<p><strong><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">2. Create a small test set<\/span><\/strong><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Don&#8217;t test a prompt on just one example. Make perhaps 10\u201350 representative inputs, including:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Normal\/easy cases<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Ambiguous cases<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Edge cases<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Very long inputs<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Inputs with missing information<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Inputs designed to expose common mistakes<\/span><\/p>\n<p><strong><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">3. Establish a baseline<\/span><\/strong><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Run your original prompt against the test set and record the results.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">For example:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Test Baseline result<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Accuracy 8\/10<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Required format 7\/10<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Completeness 6\/10<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Overall 70%<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Now you have something to compare improvements against.<\/span><\/p>\n<p><strong><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">4. Change one variable at a time<\/span><\/strong><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Suppose your original prompt says:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Summarize this customer complaint.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">You might test:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Summarize this customer complaint in 3 bullet points. Include the customer&#8217;s main problem, desired resolution, and urgency.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Don&#8217;t simultaneously change the model, temperature, instructions, output format, and examples. Otherwise, you won&#8217;t know what caused the improvement.<\/span><\/p>\n<p><strong><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">5. Test different prompt techniques<\/span><\/strong><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Useful things to experiment with include:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Clear instructions<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Extract the customer&#8217;s primary complaint.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Constraints<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Respond in exactly 3 bullet points.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Output schema<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Return JSON with the fields problem, requested_resolution, and urgency.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Examples (few-shot prompting)<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Give the model 2\u20135 examples of inputs and ideal outputs.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Explicit criteria<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">A successful answer must identify the problem, avoid unsupported assumptions, and distinguish facts from opinions.<\/span><\/p>\n<p><strong><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">6. Use a rubric or automated evaluator<\/span><\/strong><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">For larger-scale testing, have an evaluator score each response against explicit criteria.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">For example:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Score from 0\u20132:<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">1. Correctly identifies the main issue.<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">2. Includes all required information.<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">3. Makes no unsupported claims.<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">4. Follows the requested format.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">0 = fails<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">1 = partially succeeds<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">2 = fully succeeds<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">This is much more useful than simply asking, \u201cDoes this prompt seem better?\u201d<\/span><\/p>\n<p><strong><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">7. Test for regressions<\/span><\/strong><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">A prompt can improve one category while making another worse.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">For example:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Version A: 92% accurate, but often too verbose<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Version B: 95% accurate, but only 80% format compliance<\/span><br \/>\n<span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Version C: 94% accurate and 97% format compliance<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">You want to compare the whole evaluation, not just your favorite examples.<\/span><\/p>\n<p><strong><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">8. Test repeatedly<\/span><\/strong><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">AI outputs can vary. Run important test cases multiple times rather than judging a prompt from a single response.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">A simple prompt-testing loop is:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Prompt \u2192 Test set \u2192 Outputs \u2192 Evaluation \u2192 Modify \u2192 Retest<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">For production systems, keep a permanent regression test set so that every prompt change can be checked against previous behavior.<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">A practical rule<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">The biggest mistake in prompt testing is asking:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">\u201cWhich prompt sounds better?\u201d<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">Instead ask:<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">\u201cWhich prompt produces better measurable results on representative examples?\u201d<\/span><\/p>\n<p><span style=\"font-family: verdana, geneva, sans-serif; font-size: 14pt;\">That shift\u2014from subjective preference to systematic evaluation\u2014is what turns prompt engineering into a reliable testing process.<\/span><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Test AI Prompts Testing AI prompts is essentially treating your prompt like an experiment: change one thing at a time, measure the output, and keep&#8230;<\/p>\n","protected":false},"author":5,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"slim_seo":{"title":"How to Test AI Prompts - AI Prompts","description":"Test AI Prompts Testing AI prompts is essentially treating your prompt like an experiment: change one thing at a time, measure the output, and keep what works."},"_slim_seo_primary_term_category":0,"_slim_seo_primary_term_post_tag":0,"footnotes":""},"categories":[1],"tags":[],"class_list":["post-14291","post","type-post","status-publish","format-standard","hentry","category-ai-prompts","wpcat-1-id"],"_links":{"self":[{"href":"https:\/\/mickeylieberman.com\/aiprompts\/wp-json\/wp\/v2\/posts\/14291","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/mickeylieberman.com\/aiprompts\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/mickeylieberman.com\/aiprompts\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/mickeylieberman.com\/aiprompts\/wp-json\/wp\/v2\/users\/5"}],"replies":[{"embeddable":true,"href":"https:\/\/mickeylieberman.com\/aiprompts\/wp-json\/wp\/v2\/comments?post=14291"}],"version-history":[{"count":0,"href":"https:\/\/mickeylieberman.com\/aiprompts\/wp-json\/wp\/v2\/posts\/14291\/revisions"}],"wp:attachment":[{"href":"https:\/\/mickeylieberman.com\/aiprompts\/wp-json\/wp\/v2\/media?parent=14291"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/mickeylieberman.com\/aiprompts\/wp-json\/wp\/v2\/categories?post=14291"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/mickeylieberman.com\/aiprompts\/wp-json\/wp\/v2\/tags?post=14291"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}