{"id":3589,"date":"2026-07-28T11:41:36","date_gmt":"2026-07-28T11:41:36","guid":{"rendered":"https:\/\/www.mhtechin.com\/support\/?p=3589"},"modified":"2026-07-28T11:41:36","modified_gmt":"2026-07-28T11:41:36","slug":"the-power-of-effort-levels-fine-tuning-ai-performance-for-speed-cost-and-quality","status":"publish","type":"post","link":"https:\/\/www.mhtechin.com\/support\/the-power-of-effort-levels-fine-tuning-ai-performance-for-speed-cost-and-quality\/","title":{"rendered":"The Power of Effort Levels: Fine-Tuning AI Performance for Speed, Cost, and Quality"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><em>How adjusting effort settings can balance quality, speed, and cost<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Introduction<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">When you send a request to a large language model, you might assume it applies the same &#8220;brainpower&#8221; to every query. In reality, modern AI systems offer a powerful but often overlooked lever:&nbsp;<strong>effort level<\/strong>. This setting\u2014available in various forms across platforms\u2014controls how much reasoning, token generation, and computational depth the model dedicates to your task.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Many users leave this dial at default, missing out on significant opportunities to optimize for speed, cost, and output quality. A simple fact-check doesn&#8217;t need the same effort as a strategic business analysis, yet treating them equally wastes both money and time.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">This article demystifies effort levels, provides concrete strategies for adjusting them, and shows you how to match effort to task complexity\u2014unlocking the full potential of AI while keeping costs under control.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Understanding Effort Levels<\/h3>\n\n\n\n<h4 class=\"wp-block-heading\">What They Mean<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Effort level determines the model&#8217;s internal &#8220;thinking&#8221; budget. In practical terms, it influences:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Reasoning depth<\/strong>: How many intermediate steps the model takes before answering.<\/li>\n\n\n\n<li><strong>Output length and detail<\/strong>: Higher effort typically produces longer, more nuanced responses.<\/li>\n\n\n\n<li><strong>Latency<\/strong>: More effort means more computation, increasing response time.<\/li>\n\n\n\n<li><strong>Token consumption<\/strong>: Output tokens usually rise with effort, directly affecting cost.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Different providers implement this concept differently:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>OpenAI&#8217;s o1 series<\/strong>\u00a0offers a\u00a0<code>reasoning_effort<\/code>\u00a0parameter with values\u00a0<code>low<\/code>,\u00a0<code>medium<\/code>, or\u00a0<code>high<\/code>, which controls the number of reasoning tokens generated internally before producing the final answer.<\/li>\n\n\n\n<li><strong>Anthropic&#8217;s Claude<\/strong>\u00a0supports a\u00a0<code>thinking<\/code>\u00a0budget (in tokens) that you can allocate for step\u2011by\u2011step reasoning.<\/li>\n\n\n\n<li><strong>Google&#8217;s Gemini<\/strong>\u00a0doesn&#8217;t expose a direct effort parameter, but you can simulate it via system instructions and temperature settings.<\/li>\n\n\n\n<li><strong>Open\u2011source models<\/strong>\u00a0often rely on inference\u2011time techniques like chain\u2011of\u2011thought prompting or self\u2011consistency to achieve similar effects.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Understanding your provider&#8217;s specific mechanism is the first step to effective control.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">How Effort Differs from Temperature<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Many users confuse effort with temperature. They are distinct:<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><thead><tr><th class=\"has-text-align-left\" data-align=\"left\">Parameter<\/th><th class=\"has-text-align-left\" data-align=\"left\">Controls<\/th><th class=\"has-text-align-left\" data-align=\"left\">Effect<\/th><\/tr><\/thead><tbody><tr><td><strong>Effort<\/strong><\/td><td>Depth of reasoning and token budget<\/td><td>Influences how much the model &#8220;thinks&#8221;<\/td><\/tr><tr><td><strong>Temperature<\/strong><\/td><td>Randomness and creativity<\/td><td>Influences how predictable or surprising the output is<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">You can combine them: high effort + low temperature yields a thorough but deterministic answer; high effort + high temperature yields a creative yet grounded exploration.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Why Effort Levels Matter<\/h3>\n\n\n\n<h4 class=\"wp-block-heading\">Speed and Latency<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">In real\u2011time applications\u2014chatbots, live customer support, interactive coding assistants\u2014every millisecond counts. A high\u2011effort response might take 5\u201110 seconds, while low effort delivers in under a second. For user\u2011facing tools, perceived speed directly impacts satisfaction.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Scenario<\/strong>: An e\u2011commerce chatbot answering &#8220;What&#8217;s your return policy?&#8221; can use low effort for instant replies, reserving high effort only for complex refund disputes.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">Cost Implications<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Since many providers charge per token (input + output), high\u2011effort responses that generate longer outputs can multiply your costs. At scale, the difference between low and high effort could mean thousands of dollars per month.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Example<\/strong>: If a medium\u2011effort summary uses 300 tokens and high effort uses 800 tokens, the cost difference is 2.6\u00d7\u2014without necessarily delivering 2.6\u00d7 more value for every query.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">Output Quality and Depth<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Certain tasks genuinely demand deep reasoning:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Mathematical proofs<\/li>\n\n\n\n<li>Legal contract analysis<\/li>\n\n\n\n<li>Strategic business planning<\/li>\n\n\n\n<li>Scientific hypothesis evaluation<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">For these, low effort produces shallow or even incorrect answers. High effort reduces hallucinations, catches edge cases, and offers more robust reasoning chains.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">Context Window Management<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Effort affects how much of the context window is consumed. If you&#8217;re already near the limit, high\u2011effort responses with long reasoning chains might push you over, causing truncation. In such cases, lower effort (or using a separate summary step) preserves space.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">The Three Effort Tiers<\/h3>\n\n\n\n<h4 class=\"wp-block-heading\">Low Effort: When to Use<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Characteristics<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Fastest responses (&lt; 1\u20132 seconds)<\/li>\n\n\n\n<li>Short outputs (50\u2013300 tokens)<\/li>\n\n\n\n<li>Minimal reasoning; often relies on pattern matching<\/li>\n\n\n\n<li>Best for deterministic or factual queries<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Ideal Use Cases<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Simple FAQs and definitions<\/li>\n\n\n\n<li>Basic translations of short text<\/li>\n\n\n\n<li>Format conversions (e.g., &#8220;Turn this list into JSON&#8221;)<\/li>\n\n\n\n<li>Quick spell\u2011check or grammar fixes<\/li>\n\n\n\n<li>Routine data extraction (e.g., &#8220;Extract all email addresses&#8221;)<\/li>\n\n\n\n<li>First\u2011pass summarization of well\u2011structured documents<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Sample Prompt<\/strong>:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">text<\/p>\n\n\n\n<pre class=\"wp-block-preformatted\">Low effort: \"What is the capital of Norway?\"<\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Response: &#8220;Oslo.&#8221; (concise, correct)<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Settings<\/strong>&nbsp;(if using API):<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><code>reasoning_effort: \"low\"<\/code><\/li>\n\n\n\n<li><code>max_tokens: 150<\/code><\/li>\n\n\n\n<li><code>temperature: 0.2<\/code><\/li>\n\n\n\n<li>No chain\u2011of\u2011thought instructions<\/li>\n<\/ul>\n\n\n\n<h4 class=\"wp-block-heading\">Medium Effort: The Workhorse<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Characteristics<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Balanced speed (2\u20134 seconds)<\/li>\n\n\n\n<li>Moderate output length (300\u20131000 tokens)<\/li>\n\n\n\n<li>Includes some reasoning but not exhaustive<\/li>\n\n\n\n<li>Suitable for the majority of daily tasks<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Ideal Use Cases<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Drafting emails, memos, and reports<\/li>\n\n\n\n<li>Summarizing articles or meeting notes<\/li>\n\n\n\n<li>Brainstorming ideas for content or projects<\/li>\n\n\n\n<li>Code debugging with error explanations<\/li>\n\n\n\n<li>Customer service responses that require personalisation<\/li>\n\n\n\n<li>Intermediate data analysis (e.g., &#8220;What trends do you see?&#8221;)<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Sample Prompt<\/strong>:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">text<\/p>\n\n\n\n<pre class=\"wp-block-preformatted\">Medium effort: \"Draft a professional email to a client thanking them for their recent meeting and proposing next steps for our collaboration.\"<\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Response: A 200\u2011word email with a polite tone, clear action items, and a call to action.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Settings<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><code>reasoning_effort: \"medium\"<\/code><\/li>\n\n\n\n<li><code>max_tokens: 600<\/code><\/li>\n\n\n\n<li><code>temperature: 0.6<\/code><\/li>\n\n\n\n<li>Optionally add: &#8220;Provide a brief rationale for your suggestions.&#8221;<\/li>\n<\/ul>\n\n\n\n<h4 class=\"wp-block-heading\">High Effort: Going Deep<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Characteristics<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Slower responses (5\u201315+ seconds)<\/li>\n\n\n\n<li>Long outputs (1000\u20134000+ tokens)<\/li>\n\n\n\n<li>Extensive reasoning, often with step\u2011by\u2011step chains<\/li>\n\n\n\n<li>Low hallucination rate; high accuracy on complex tasks<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Ideal Use Cases<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Complex problem\u2011solving (mathematical proofs, logic puzzles)<\/li>\n\n\n\n<li>In\u2011depth research synthesis from multiple documents<\/li>\n\n\n\n<li>Legal document analysis or contract review<\/li>\n\n\n\n<li>Strategic planning and scenario analysis<\/li>\n\n\n\n<li>Scientific hypothesis generation<\/li>\n\n\n\n<li>High\u2011stakes decision support (medical, financial, regulatory)<\/li>\n\n\n\n<li>Creative writing with intricate plots and character development<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Sample Prompt<\/strong>:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">text<\/p>\n\n\n\n<pre class=\"wp-block-preformatted\">High effort: \"Analyze the potential impact of a 2% interest rate increase on our company's cash flow over the next 12 months, considering our debt structure, customer payment cycles, and hedging strategies. Provide a detailed rationale.\"<\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Response: A multi\u2011paragraph analysis with assumptions, calculations, sensitivity scenarios, and actionable recommendations.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Settings<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><code>reasoning_effort: \"high\"<\/code><\/li>\n\n\n\n<li><code>max_tokens: 2500<\/code><\/li>\n\n\n\n<li><code>temperature: 0.3<\/code>\u00a0(for precision) or\u00a0<code>0.7<\/code>\u00a0(for exploratory)<\/li>\n\n\n\n<li>Explicit instruction: &#8220;Think step by step and show your reasoning.&#8221;<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">How to Set Effort Levels<\/h3>\n\n\n\n<h4 class=\"wp-block-heading\">API Parameters and Controls<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">If your provider exposes effort directly, use the appropriate parameter:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>OpenAI (o1 models)<\/strong>:json{ &#8220;model&#8221;: &#8220;o1-preview&#8221;, &#8220;reasoning_effort&#8221;: &#8220;medium&#8221;, &#8220;max_completion_tokens&#8221;: 1000 }<\/li>\n\n\n\n<li><strong>Anthropic (Claude)<\/strong>:json{ &#8220;model&#8221;: &#8220;claude-3-7-sonnet-20250219&#8221;, &#8220;thinking&#8221;: { &#8220;type&#8221;: &#8220;enabled&#8221;, &#8220;budget_tokens&#8221;: 16000 } }Higher budget tokens = more effort.<\/li>\n\n\n\n<li><strong>Other models<\/strong>\u00a0without direct effort: Use system instructions, e.g., &#8220;Take your time and provide a thorough, detailed response&#8221; or &#8220;Give a concise, high\u2011level answer.&#8221;<\/li>\n<\/ul>\n\n\n\n<h4 class=\"wp-block-heading\">Prompt Engineering Techniques<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">You can simulate effort adjustments through careful prompting:<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><thead><tr><th class=\"has-text-align-left\" data-align=\"left\">Desired Effort<\/th><th class=\"has-text-align-left\" data-align=\"left\">Prompt Phrase<\/th><\/tr><\/thead><tbody><tr><td><strong>Low<\/strong><\/td><td>&#8220;Give a brief, one\u2011sentence answer.&#8221; \/ &#8220;Summarize in 10 words or fewer.&#8221;<\/td><\/tr><tr><td><strong>Medium<\/strong><\/td><td>&#8220;Provide a balanced overview with key points.&#8221; \/ &#8220;Explain in 3\u20135 bullet points.&#8221;<\/td><\/tr><tr><td><strong>High<\/strong><\/td><td>&#8220;Think step by step.&#8221; \/ &#8220;Provide a comprehensive analysis with evidence.&#8221; \/ &#8220;Consider all possible edge cases.&#8221;<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Additionally, you can use&nbsp;<strong>output length constraints<\/strong>&nbsp;(e.g.,&nbsp;<code>max_tokens<\/code>) to cap effort indirectly.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">Combining with Temperature and Top\u2011P<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Effort and randomness work together:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Low effort + low temperature (0.1\u20130.3)<\/strong>\u00a0\u2192 fastest, most deterministic.<\/li>\n\n\n\n<li><strong>Medium effort + moderate temperature (0.5\u20130.7)<\/strong>\u00a0\u2192 balanced for most tasks.<\/li>\n\n\n\n<li><strong>High effort + higher temperature (0.8\u20131.0)<\/strong>\u00a0\u2192 creative, exploratory depth (good for brainstorming).<\/li>\n\n\n\n<li><strong>High effort + low temperature (0.1\u20130.2)<\/strong>\u00a0\u2192 precise, analytical depth (good for calculations).<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Strategic Effort Management<\/h3>\n\n\n\n<h4 class=\"wp-block-heading\">Iterative Scaling<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Start low and increase only if needed. This is the most cost\u2011effective strategy:<\/p>\n\n\n\n<ol start=\"1\" class=\"wp-block-list\">\n<li><strong>Step 1<\/strong>: Send the request with low effort.<\/li>\n\n\n\n<li><strong>Step 2<\/strong>: If the response is insufficient, re\u2011prompt with medium effort.<\/li>\n\n\n\n<li><strong>Step 3<\/strong>: If still lacking, escalate to high effort.<\/li>\n<\/ol>\n\n\n\n<p class=\"wp-block-paragraph\">This approach avoids wasting tokens on simple queries while ensuring complex ones get the depth they need.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">Task Categorization<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Create a decision matrix for recurring task types:<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><thead><tr><th class=\"has-text-align-left\" data-align=\"left\">Task Type<\/th><th class=\"has-text-align-left\" data-align=\"left\">Recommended Effort<\/th><th class=\"has-text-align-left\" data-align=\"left\">Rationale<\/th><\/tr><\/thead><tbody><tr><td>FAQ answers<\/td><td>Low<\/td><td>Factual, deterministic<\/td><\/tr><tr><td>Email drafts<\/td><td>Medium<\/td><td>Needs personalisation but not deep reasoning<\/td><\/tr><tr><td>Code generation (routine)<\/td><td>Medium<\/td><td>Standard patterns<\/td><\/tr><tr><td>Code debugging (complex)<\/td><td>High<\/td><td>Requires careful tracing<\/td><\/tr><tr><td>Market research summary<\/td><td>Medium<\/td><td>Balanced depth<\/td><\/tr><tr><td>Strategic recommendation<\/td><td>High<\/td><td>High stakes, nuance required<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<h4 class=\"wp-block-heading\">Cost\u2011Benefit Analysis<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">For high\u2011volume applications, calculate the cost per query at each effort level and compare to the value delivered.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Example<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Low effort costs $0.001 per query; medium costs $0.003; high costs $0.009.<\/li>\n\n\n\n<li>If 80% of queries are simple, switching them to low saves $0.008 per query \u00d7 volume.<\/li>\n\n\n\n<li>Even if high effort improves accuracy by 20% on complex cases, the overall cost efficiency improves dramatically.<\/li>\n<\/ul>\n\n\n\n<h4 class=\"wp-block-heading\">Batch vs. Real\u2011Time Decisions<\/h4>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Real\u2011time (chat, live support)<\/strong>: Prioritise low or medium effort to maintain responsiveness.<\/li>\n\n\n\n<li><strong>Batch processing (report generation, data analysis)<\/strong>: Use high effort because time is less critical and accuracy is paramount.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Practical Examples<\/h3>\n\n\n\n<h4 class=\"wp-block-heading\">Example 1: Customer Support<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Task<\/strong>: Respond to a user asking, &#8220;How do I reset my password?&#8221;<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Low effort<\/strong>\u00a0(2 seconds): &#8220;Go to the login page, click &#8216;Forgot password&#8217;, and follow the email instructions.&#8221; \u2014 Perfect.<\/li>\n\n\n\n<li><strong>High effort<\/strong>\u00a0would be overkill (and expensive).<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Task<\/strong>: Respond to a user with &#8220;I tried resetting my password but never received the email. I&#8217;ve checked spam.&#8221;<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Medium effort<\/strong>: Provide troubleshooting steps (check spam, verify email, resend, contact support) \u2014 adequate.<\/li>\n\n\n\n<li>If the issue persists, escalate to high effort for a detailed diagnostic.<\/li>\n<\/ul>\n\n\n\n<h4 class=\"wp-block-heading\">Example 2: Research Synthesis<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Task<\/strong>: Summarise a 50\u2011page academic paper.<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Low effort<\/strong>: Returns a 2\u2011sentence abstract \u2014 too shallow.<\/li>\n\n\n\n<li><strong>Medium effort<\/strong>: Produces a 300\u2011word summary with key findings, methodology, and conclusions \u2014 good for quick overview.<\/li>\n\n\n\n<li><strong>High effort<\/strong>: Generates a 1500\u2011word critical review with strengths, weaknesses, implications, and comparisons to related work \u2014 ideal for literature review.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Strategy<\/strong>: Use medium for daily reading; high for final synthesis before a publication.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">Example 3: Code Generation<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Task<\/strong>: Write a Python function to sort a list.<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Low effort<\/strong>: Returns a simple\u00a0<code>sorted()<\/code>\u00a0call \u2014 fine.<\/li>\n\n\n\n<li><strong>Medium effort<\/strong>: Adds error handling and type hints.<\/li>\n\n\n\n<li><strong>High effort<\/strong>: Provides multiple sorting algorithms with performance comparisons, edge\u2011case tests, and documentation.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Strategy<\/strong>: Use low for boilerplate, high for performance\u2011critical or safety\u2011critical code.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Common Pitfalls<\/h3>\n\n\n\n<h4 class=\"wp-block-heading\">Overusing High Effort<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">The most common mistake is setting high effort as the default. This leads to:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Slow responses frustrating users.<\/li>\n\n\n\n<li>High operational costs.<\/li>\n\n\n\n<li>Longer outputs that may include unnecessary fluff.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Solution<\/strong>: Audit your usage\u2014most queries likely don&#8217;t need high effort.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">Underestimating Low Effort<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Some users assume low effort means poor quality. In reality, many tasks are well\u2011served by low effort, and the model can still be accurate.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Solution<\/strong>: Test low effort on a sample of your queries; you might be surprised at the quality.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">Ignoring Model\u2011Specific Nuances<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Effort settings are not universal. What works for OpenAI&#8217;s o1 may not translate to Claude or Gemini. Always consult the provider&#8217;s documentation and run benchmarks.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Solution<\/strong>: Create a small test suite for each model and effort level to calibrate.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Measuring and Monitoring Effort Efficiency<\/h3>\n\n\n\n<h4 class=\"wp-block-heading\">Tracking Metrics<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">To optimise effort, track these KPIs:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Average response time<\/strong>\u00a0per effort tier.<\/li>\n\n\n\n<li><strong>Token usage<\/strong>\u00a0(input + output) per tier.<\/li>\n\n\n\n<li><strong>Cost per query<\/strong>.<\/li>\n\n\n\n<li><strong>User satisfaction<\/strong>\u00a0or accuracy scores.<\/li>\n\n\n\n<li><strong>Retry rate<\/strong>\u00a0(how often a low\u2011effort query needs a higher\u2011effort follow\u2011up).<\/li>\n<\/ul>\n\n\n\n<h4 class=\"wp-block-heading\">Benchmarking Quality<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Run periodic blind tests where you compare outputs from different effort levels against a gold standard (human expert or known correct answer). This helps you determine the minimal effort required for acceptable quality.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Example<\/strong>: For your summarisation task, you might find that medium effort achieves 95% of high effort&#8217;s quality at 40% of the cost\u2014making medium the clear winner.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Advanced Techniques<\/h3>\n\n\n\n<h4 class=\"wp-block-heading\">Dynamic Effort Based on Confidence<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Implement a confidence\u2011based system:<\/p>\n\n\n\n<ol start=\"1\" class=\"wp-block-list\">\n<li>Send the query with low effort.<\/li>\n\n\n\n<li>Also request a confidence score (e.g., &#8220;On a scale of 1\u201310, how confident are you in this answer?&#8221;).<\/li>\n\n\n\n<li>If confidence is below a threshold, automatically re\u2011send with medium or high effort.<\/li>\n<\/ol>\n\n\n\n<p class=\"wp-block-paragraph\">This hybrid approach optimises both speed and accuracy.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\">Hybrid Approaches<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Combine multiple models or effort levels in a pipeline:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Stage 1<\/strong>\u00a0(low effort): Extract key entities or questions.<\/li>\n\n\n\n<li><strong>Stage 2<\/strong>\u00a0(medium effort): Generate a draft response.<\/li>\n\n\n\n<li><strong>Stage 3<\/strong>\u00a0(high effort): Only invoked for the most complex cases, e.g., for quality assurance.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">This is common in enterprise RAG systems where retrieval uses lightweight models, and generation uses heavier ones.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Conclusion<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Effort levels are one of the most powerful, yet underutilised, controls in AI interaction. By deliberately choosing the right level for each task, you can achieve faster responses, lower costs, and better\u2011aligned outputs\u2014without sacrificing quality where it truly matters.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">The key is intentionality. Before every prompt, ask yourself: &#8220;Does this query require deep reasoning or just a quick answer?&#8221; Then set the dial accordingly. Over time, you&#8217;ll develop an intuition for effort allocation, much like a seasoned driver knows when to accelerate and when to coast.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Start today. Audit your recent queries, categorise them by complexity, and experiment with different effort levels. You&#8217;ll likely discover that you&#8217;ve been overpaying for routine tasks and under\u2011serving critical ones. The balance is within reach\u2014and it starts with turning the effort dial.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<p class=\"has-text-align-right wp-block-paragraph\">&#8212; Indraneil Dhere<\/p>\n","protected":false},"excerpt":{"rendered":"<p>How adjusting effort settings can balance quality, speed, and cost Introduction When you send a request to a large language model, you might assume it applies the same &#8220;brainpower&#8221; to every query. In reality, modern AI systems offer a powerful but often overlooked lever:&nbsp;effort level. This setting\u2014available in various forms across platforms\u2014controls how much reasoning, [&hellip;]<\/p>\n","protected":false},"author":76,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1],"tags":[],"class_list":["post-3589","post","type-post","status-publish","format-standard","hentry","category-support"],"_links":{"self":[{"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/posts\/3589","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/users\/76"}],"replies":[{"embeddable":true,"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/comments?post=3589"}],"version-history":[{"count":1,"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/posts\/3589\/revisions"}],"predecessor-version":[{"id":3590,"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/posts\/3589\/revisions\/3590"}],"wp:attachment":[{"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/media?parent=3589"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/categories?post=3589"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.mhtechin.com\/support\/wp-json\/wp\/v2\/tags?post=3589"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}