<?xml version="1.0" encoding="UTF-8"?><urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
          <url>
            <loc>https://1cademy.com/node/the-data-centric-shift-in-language-model-development/02p67Y18JOXy3otSTNIs</loc>
            <lastmod>2026-02-08T14:07:27.838Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generating-inputs-and-outputs-for-comprehensive-fine-tuning/04GSu91bIfyFQp6XcVYx</loc>
            <lastmod>2026-05-01T01:25:58.325Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-to-learn-human-preferences-by-minimizing-a-ranking-loss-function-thi/07Hcc9dXmepyNUs3hKcG</loc>
            <lastmod>2025-10-02T09:15:11.694Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/supervised-fine-tuning-for-llm-alignment/08faEtjclu6sAmLz7MxZ</loc>
            <lastmod>2026-06-22T21:49:48.187Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-scenario-the-performance-of-a-new-policy-defined-by-parameters-is-often-/09OekBPAouhISCw2ExD3</loc>
            <lastmod>2025-10-08T20:16:34.914Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-an-llms-learning-framework/0ERwhtXvWKQLRni0ByPu</loc>
            <lastmod>2025-10-06T12:44:03.338Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/binary-encoding-of-pairwise-feedback-in-rlhf/0FLQ548vS7hLxGxJijrv</loc>
            <lastmod>2026-05-01T18:08:37.166Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/distinguishing-types-of-nlp-alignment/0G3YkLGptvMN1SU7G2g9</loc>
            <lastmod>2025-10-06T16:45:00.091Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-approximated-policy-divergence-penalty-formula-textpenalty-sumtt-log-pithetaatst-sumtt-/0L9VUWfJtL4AiKIZ98LR</loc>
            <lastmod>2025-10-08T15:26:42.668Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-shifting-their-strategy-for-aligning-a-language-model-with-human-preferences-thei/0LIcPe0qwGFsu02ndnuZ</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-company-is-rolling-out-an-instruction-tuned-l/0PSFmlpO0RHoMlGLVKci</loc>
            <lastmod>2026-02-08T13:57:06.253Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-gradient-algorithm-a-common-technique-to-stabilize-learning-is-to-subtract-a-calculated-/0SQ84itjGOnI8XKBBpuF</loc>
            <lastmod>2025-10-02T22:29:21.690Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-must-choose-the-best-response-from-a-set-of-three-options-a-b-and-c-a-reward/0ViMDxrYm8CRLFKo8CX9</loc>
            <lastmod>2025-10-02T02:39:11.700Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-an-ensemble-of-reward-models/0XDFyiAzPwGCiBRlGk5L</loc>
            <lastmod>2025-10-06T22:15:46.993Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-refining-a-large-language-model-to-be-more-helpful-and-harmless-they-are-using/0XNAyJyBASpeDoC3Uutp</loc>
            <lastmod>2025-10-03T04:11:05.185Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-controls-a-robot-vacuum-cleaner-the-primary-goal-is-for-the-robot-to-/0Yrnw6kUZyViEZpBN2yD</loc>
            <lastmod>2025-10-04T05:03:59.815Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-considering-two-different-methods-for-training-a-conversational-assistant-/0ax1KCKrrF9oVt5PKxq3</loc>
            <lastmod>2025-09-26T13:49:40.893Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-alignment-algorithm-calculates-the-probability-of-a-preferred-response-ya-over-a-dispreferred-res/0c8x3PMF7jmUj5U6qhTK</loc>
            <lastmod>2025-10-06T03:23:57.504Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-language-model-training-objectives/0cpwrczZpvfVbphDGx2e</loc>
            <lastmod>2025-10-10T09:31:02.099Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/language-model-performance-analysis/0d0x1nla2QYd3QRLqdPM</loc>
            <lastmod>2025-09-26T11:35:14.941Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-failure-of-a-simplification-heuristic/0dJuj6tZLRwiT0hHonwl</loc>
            <lastmod>2025-10-06T13:06:30.949Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/direct-supervision-via-knowledge-distillation-loss-in-weak-to-strong-generalization/0gAMV380Pe4qg3N1X4F8</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-improving-a-policy-gradient-estimator-the-total-reward-for-a-trajectory-sumkt-rk-i/0gbMcc1u8VUxtIS68BRz</loc>
            <lastmod>2025-10-07T09:16:41.280Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-generation-strategy-for-a-specialized-ai-assistant/0jMxJibBI2hYtV2knmF3</loc>
            <lastmod>2025-10-02T04:33:55.638Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-fine-tuning-for-chatbot-development/0k3YYi4umhUEVzoKbO7e</loc>
            <lastmod>2026-04-19T23:41:54.242Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-summarization-prompt-with-a-sentence-constraint/0kVnzPQFmrKCRixygVdM</loc>
            <lastmod>2025-10-09T00:41:45.017Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-reward-hacking-the-homework-analogy/0kifj63jFIj65pyHSRFa</loc>
            <lastmod>2025-10-09T00:42:24.993Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-must-choose-an-alignment-approach-for-an/0mGAMk7fT2tF7KQ5J5Lr</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/alpagasus-data-selection-system/0nWP4gGXBZOe1Y2Hlxp3</loc>
            <lastmod>2026-05-01T10:28:26.171Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-soft-prompt-generalization/0ntxZ4K341AEH3xIYlts</loc>
            <lastmod>2025-10-08T15:15:40.896Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/separation-of-sampling-and-reward-computation-in-policy-learning/0p3Doa6D3Folnx74IJnC</loc>
            <lastmod>2026-05-01T18:36:30.908Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-term-alignment-has-been-used-in-natural-language-processing-for-different-purposes-over-time-mat/0pZgqrxtdQd27DkCe6Xh</loc>
            <lastmod>2025-10-02T21:39:46.554Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-small-startup-has-access-to-a-large-pre-trained-language-model-their-goal-is-to-make-the-model-gen/0s6MkOReSJ9pboP2pvFf</loc>
            <lastmod>2025-10-04T17:05:30.209Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-model-behavior/0tu3tbRnHjHc1tsYCSZT</loc>
            <lastmod>2025-10-04T04:31:32.621Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-training-a-reward-model-observes-a-peculiar-behavior-the-model-consistently-assigns-higher-sc/0uRuiJKDp79TDwgZ0XHv</loc>
            <lastmod>2025-09-26T10:30:02.759Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-training-instability-in-llm-alignment/0vCGMWF2Oda8ItauZlpg</loc>
            <lastmod>2025-10-06T01:37:17.194Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-model-is-being-trained-to-evaluate-text-completions-for-a-given-prompt-the-training-data-consists-/0vlIDoVRz51W53SdpZqz</loc>
            <lastmod>2025-09-26T05:56:04.575Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/few-shot-learning-in-prompting/0wNpTUcYZHSN9SCvdObc</loc>
            <lastmod>2026-05-15T06:10:08.880Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/effectiveness-of-sparse-but-informative-human-feedback-in-rlhf/0xOdGNVJjajX9qwhPXHm</loc>
            <lastmod>2025-10-10T09:53:06.586Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-using-a-policy-gradient-method-the-objective-is-to-maximize-the-function-u/0y7gZcV0s1HRMuI06qq5</loc>
            <lastmod>2025-09-29T00:10:14.226Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/model-adaptation-for-creative-slogan-generation/0yRCglJaE3GXgAFXXw7t</loc>
            <lastmod>2025-10-02T17:54:48.824Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/input-and-output-formulation-in-bon-sampling/0yVynfkWZ44uDT3J1Xly</loc>
            <lastmod>2026-05-03T15:31:38.460Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-an-ai-assistants-behavior/102HnCNXoJLMs6SbZxZS</loc>
            <lastmod>2026-02-08T13:12:07.539Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-segmentation-to-code-generation-reward-models/11O6Jr9aiK45j0rZXLnf</loc>
            <lastmod>2025-10-03T02:08:20.516Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/establishing-a-performance-baseline/11ayoLBpN9zB2TvBYdQb</loc>
            <lastmod>2025-09-28T23:56:49.642Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-naturally-occurring-internet-data-for-fine-tuning/11luGSk7QI0nBPC4sfNV</loc>
            <lastmod>2026-05-01T01:06:27.892Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-model-confidence-via-log-likelihood/12rCReTW52CnSVWCj4mz</loc>
            <lastmod>2025-10-04T03:18:22.929Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/agent-in-reinforcement-learning/14M8YDBi2TFi00J8u8cN</loc>
            <lastmod>2026-05-01T15:58:10.233Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/combined-loss-objective-in-weak-to-strong-training/16ujgNax4m0yF2PPgr4L</loc>
            <lastmod>2025-10-10T09:55:59.176Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/richer-annotation-schemes-for-reasoning-steps/18qSTAPbZuOizr6Kn9ZS</loc>
            <lastmod>2026-05-03T15:05:33.042Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/function-of-a-sequence-notation-sbarmathbfy-dots-barmathbfyk/19VmiTxLTAyQvGX5rFhr</loc>
            <lastmod>2026-06-28T12:18:24.168Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reference-policy-in-rlhf/1E55sXaIJqAMm5deYetP</loc>
            <lastmod>2026-06-30T20:20:28.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimization-goal-for-soft-prompt-learning-via-context-compression/1EZkdQAVBtjFojB9N5Fi</loc>
            <lastmod>2026-04-30T22:07:04.941Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-startup-is-developing-a-new-specialized-language-model-for-the-legal-industry-to-train-their-model/1IYb68Q0bScmpo38nIJE</loc>
            <lastmod>2025-10-02T03:55:15.772Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-very-large-powerful-language-model-instead-of-using-human-labele/1JN3n6znyWThvoPyOEwD</loc>
            <lastmod>2025-09-28T14:40:05.272Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/implementation-of-linguistic-and-semantic-segmentation/1LAnlTZTJofQgsViPfX0</loc>
            <lastmod>2026-05-03T00:17:13.170Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-feedback-collection-strategy-for-code-quality/1LLK8asouGpNg3WjwPvu</loc>
            <lastmod>2025-10-03T04:43:56.557Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-provides-a-language-model-with-a-complex-legal-document-and-the-prompt-summarize-this-documen/1ORBHmLVfFpdxP0nSOzE</loc>
            <lastmod>2025-10-08T14:08:14.093Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-selection-and-filtering-using-weak-models/1RCkz0GHI37CiGJVas8p</loc>
            <lastmod>2026-05-01T15:11:02.270Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-is-tasked-with-fine-tuning-a-pre-trained-language-model-for-a-specific-custo/1SWMLZcXqhNm15YA29Dz</loc>
            <lastmod>2025-10-06T03:24:42.977Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-fine-tuned-using-a-reinforcement-learning-approach-that-incorporates-human/1ULhuWsYDp6dXth7dhup</loc>
            <lastmod>2025-09-26T15:28:13.696Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-model-performance-via-loss-function/1V8l4SBjlobZ7uRKAecL</loc>
            <lastmod>2025-10-09T00:27:10.895Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-using-a-reinforcement-learning-process-with-human-feedback-to-align-a-large-la/1Wank91UiJIoEafAc7uH</loc>
            <lastmod>2025-09-26T06:48:46.785Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-alignment-strategy-selection/1YEBtrw148fPPxWpCov7</loc>
            <lastmod>2026-06-26T22:34:00.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/bradley-terry-model-for-preference-probability/1Zl9JR8zTBlUHmmdl8Ic</loc>
            <lastmod>2026-05-01T17:15:21.564Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-policy-model-and-wants-to-prevent-large-destabilizing-updates-between-trai/1bvke3wlFzmtC3ABChZO</loc>
            <lastmod>2025-09-26T03:29:50.915Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-multi-task-fine-tuning-strategies-for-ai-assistants/1cgSVk4KvBlEN7rR3Ldx</loc>
            <lastmod>2026-02-08T14:41:28.019Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-to-minimize-the-following-objective-functionobjective-e-rewardx-y-/1gEZ8zcpOgyTloXU4KzO</loc>
            <lastmod>2026-05-03T00:35:23.712Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/total-reward-return/1gX5Ik1GvHYKqLWVnZCw</loc>
            <lastmod>2026-07-03T12:13:10.871Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-in-the-context-of-llms/1jNkSmHWNOkvetLqKL7Y</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-knowledge-distillation-process-a-teacher-model-produces-a-probability-distribution-of-over-thre/1kNwBwyrUzMfpC369us8</loc>
            <lastmod>2025-10-08T20:48:39.489Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-research-team-conducts-two-separate-experiments-to-improve-a-powerful-models-performance-by-ha/1mKmMzmo7JzsHbSI5sw3</loc>
            <lastmod>2025-09-26T03:19:32.270Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ac-value-loss-for-variable-length-sequences/1oQMFUbrmR1drd2FJUK3</loc>
            <lastmod>2025-10-04T09:53:27.491Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluation-criteria-for-pairwise-comparison-in-rlhf/1ou2uo1EZ0T3kuBFOihC</loc>
            <lastmod>2025-10-10T10:05:44.949Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/adapting-a-general-model-for-a-specialized-task/1qPtJPglEaKRsoO1Yj6O</loc>
            <lastmod>2025-10-10T03:27:31.874Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-an-email-spam-classification-task/1zHuwmGDOk7JQ9OMbcOL</loc>
            <lastmod>2026-06-23T20:01:21.670Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-startup-strategy-for-legal-document-summarization/1zazTi77WOzLmYL3erCi</loc>
            <lastmod>2025-10-03T03:17:40.724Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-designed-to-improve-language-model-outputs-uses-a-special-component-this-component-takes-a-/20DTi6fFgB8HrxNhMwXN</loc>
            <lastmod>2025-10-06T18:32:12.430Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applications-of-prompt-distillation/20g9i4z6vJ2t21gFts2d</loc>
            <lastmod>2026-04-30T21:46:27.463Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-probability-ratio-less-than-one/21HifHW21XXJxbJpxklH</loc>
            <lastmod>2026-05-01T18:27:05.107Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/constructing-an-sft-data-sample-for-email-classification/21kCARQt3oGkJb47ScgM</loc>
            <lastmod>2025-10-09T03:19:24.114Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-building-a-system-to-automatically-flag-individual-user-comments-for-toxicity-/230WbWT4cnSd8NYtC0v2</loc>
            <lastmod>2025-10-02T04:36:44.204Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-is-running-rlhf-for-a-customer-facing-ll/234dIkgYSTZ8E7PC0KL8</loc>
            <lastmod>2026-02-06T17:54:08.228Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-creating-a-text-simplification-tool-using-a-sequence-to-sequence-learning-approa/23VDmLOvbyt8ZOEsQiKS</loc>
            <lastmod>2025-10-06T02:14:52.819Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/architectural-components-of-an-rlhf-system/24NosyG8lMENod3DQrZO</loc>
            <lastmod>2026-05-02T23:18:58.160Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-sourcing-strategy-for-chatbot-fine-tuning/24qlg6ocIAt1CJSF3RQ3</loc>
            <lastmod>2025-10-02T09:17:53.482Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-fine-tunes-a-large-language-model-on-a-massive-newly-generated-dataset-of-million/27nDxP2p47Eoc4bBPMzl</loc>
            <lastmod>2026-02-08T14:29:14.703Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-model-to-be-a-general-purpose-open-domain-question-answering-ass/28KJZClwt3UZwdEwVBpR</loc>
            <lastmod>2025-09-26T08:54:58.415Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/effect-of-training-on-model-parameters/2Aud9QtmmxNY4H7hyu9V</loc>
            <lastmod>2025-10-03T17:17:44.894Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-paraphrased-task-instruction/2BJ65QeVAPxNVW7g94mj</loc>
            <lastmod>2025-10-07T10:28:22.105Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-training-an-agent-if-the-ratio-of-the-current-policys-probability-to-a-reference-p/2CNNWETyuY3Wd6NbQzGK</loc>
            <lastmod>2025-10-03T19:50:13.791Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/definition-of-reward-hacking-reward-gaming/2CVjNquz8QfZPP40QTHN</loc>
            <lastmod>2025-10-07T11:42:35.868Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/parameter-efficient-methods-for-mitigating-fine-tuning-costs/2EMaOvz0yzYzQqifgSwU</loc>
            <lastmod>2026-05-01T10:29:09.486Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-an-actor-critic-reinforcement-learning-framework-the-actors-objective-is-to-adjust-its-policy-par/2KdMet3He7GH4YgOf2v6</loc>
            <lastmod>2025-10-06T14:26:47.835Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-method-for-training-a-decision-making-agent-an-update-rule-is-derived-consider-the-following-in/2LHghXahRvZBDkv2Tqaa</loc>
            <lastmod>2025-10-07T08:11:59.782Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-on-instruction-following-data-for-one-specific-training-instance-t/2LJFR3t64eiFeqm6z1Rt</loc>
            <lastmod>2025-09-26T08:50:46.143Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-collection-for-reward-modeling-in-rlhf/2MZ5Wzuw2OqvFBt5Z9CW</loc>
            <lastmod>2025-10-10T03:14:33.537Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/decomposition-of-the-trajectory-log-probability-gradient/2PzrRsi4uFZb22vdQlul</loc>
            <lastmod>2026-05-01T16:23:45.358Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-uniform-reward-shift-on-selection-probabilities/2QPvixF6yOKkPT4B50BX</loc>
            <lastmod>2025-10-04T04:59:59.676Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyze-the-notation-sbarmathbfy-dots-barmathbfyk-by-matching-each-component-with-its-correct-descri/2VDpI18NgzL8hooRuVNl</loc>
            <lastmod>2025-10-04T02:15:36.705Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/overall-ppo-objective-function-for-language-models/2cpy53TeWasrAEx9LTvP</loc>
            <lastmod>2026-07-06T10:19:13.937Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-estimate-with-baseline/2eXOjexAlCH3mLe5v0w8</loc>
            <lastmod>2026-05-01T16:35:53.540Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-and-correcting-instruction-following-failures/2enaQsSrs5OzuQ1h3lzl</loc>
            <lastmod>2025-10-06T01:54:27.762Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-problem-scenario-with-the-most-suitable-application-of-prompt-distillation/2gMfbtkd1ua6i4ge955r</loc>
            <lastmod>2025-10-06T01:15:13.970Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autonomous-agent-completes-a-task-over-four-time-steps-the-sequence-of-actions-and-resulting-rewa/2h5pJDHv7bFOF3JhLxBn</loc>
            <lastmod>2026-05-10T01:37:25.473Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-is-interacting-with-a-healthcare-assistant-chatbot-review-the-conversation-belowuser-i-have-a/2iVn72QroTZD5B4h0Uh9</loc>
            <lastmod>2025-10-09T01:14:37.575Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-model-fine-tuning/2lE1MOajvgp5O9l2HaRf</loc>
            <lastmod>2026-06-26T01:24:44.354Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-chatbot-alignment-strategy/2mBgMExC9GPv4XEYpsOO</loc>
            <lastmod>2025-10-07T10:18:37.985Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-system-that-collects-human-feedback-by-presenting-two-model-generated-responses-for-comparison-/2mCfhqL380iQS2d1JiJh</loc>
            <lastmod>2026-05-01T18:08:34.830Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-prompt-template-for-sample-generation-in-self-instruct/2oJjiAWHfVHaXJEnmnjX</loc>
            <lastmod>2026-05-01T01:24:06.542Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/weak-to-strong-generalization-problem/2r1i81zwZ0kczZO2xi1Y</loc>
            <lastmod>2026-05-01T14:47:54.345Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-diagram-illustrates-a-two-stage-workflow-for-processing-an-input-stage-labeled-cheap-uses-a-small-/2rdxVDZp1G0mVvZHjjSt</loc>
            <lastmod>2025-10-06T11:19:57.870Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-has-developed-a-very-large-language-model-that-was-pre-trained-on-a-vast-and-diverse-/2spwW4E2ZdnkZXk6ss1u</loc>
            <lastmod>2025-10-02T04:57:05.914Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-preference-model-notation/2vxo5kFKhwO8zhJk85cJ</loc>
            <lastmod>2025-09-28T22:39:22.471Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/strategies-to-mitigate-overfitting-and-catastrophic-forgetting-in-sft/2wmF7Lx2tunNkiKDnwQ8</loc>
            <lastmod>2026-05-01T00:49:09.213Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-calculation-of-the-policy-gradient-with-respect-to-the-parameters-for-an-action-at-take/2zW1abvmpuiiKDa2oL8M</loc>
            <lastmod>2025-10-06T23:04:23.177Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/post-deployment-alignment-update-choosing-between-dpo-and-rlhf-under-logging-and-compute-constraints/30HqSJ9OjVyKcJOMu4at</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-has-trained-a-language-model-to-function-as-a-specialized-chatbot-for-booking-res/30wrDo4zYN2y0fOoglbT</loc>
            <lastmod>2025-09-26T11:38:38.656Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/visual-diagram-of-data-selection-with-a-small-model/317hWRKG9CQEn5hL1Www</loc>
            <lastmod>2026-02-05T17:37:00.879Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/function-and-inputs-of-the-rlhf-reward-model/31T50zrq2sE1sOr9wM7y</loc>
            <lastmod>2026-05-01T16:54:02.825Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-fine-tunes-two-identical-large-language-models-model-a-is-fine-tuned-exclusively-on-/32q9sqHq5AiIAty2duCH</loc>
            <lastmod>2026-02-08T14:36:05.885Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-update-analysis-with-negative-advantage/336woG7xYhAxyKDZhURl</loc>
            <lastmod>2025-10-04T03:20:00.327Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/state-value-function-v-formula/33IAbUmPBvJRKFvgCRSA</loc>
            <lastmod>2026-07-01T09:19:35.943Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-chatbot-performance-issues/340dWW0ZRmVwTCfMgk6x</loc>
            <lastmod>2025-10-05T23:22:01.176Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-working-on-two-separate-improvement-goals-for-their-language-model-match-each-/34GlRroaVhdk1oZfmoJK</loc>
            <lastmod>2025-10-10T07:56:57.218Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-fine-tuning-strategy-for-a-general-purpose-ai/351NEH1kLMXXIdnhmE4J</loc>
            <lastmod>2026-02-08T14:06:04.135Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/instruction-generation-in-self-instruct/35VKaWsDh6ftwn8OjbHF</loc>
            <lastmod>2026-05-15T06:10:08.880Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-a-length-constraint-to-a-prompt/36B87pxOqicZpT6B53uj</loc>
            <lastmod>2025-10-04T05:38:15.306Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-model-discrepancies/36i8TZjWhUbZcaSBx8xn</loc>
            <lastmod>2025-10-03T06:06:59.925Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-challenge-of-candidate-diversity-in-reranking-methods/3A9pQnojxrafQKHjfaxl</loc>
            <lastmod>2026-05-03T15:34:52.491Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/performance-gap-recovered-pgr/3AdyGfYCSZdE5lsBngP8</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/action-value-function-definition/3DbUrOQ7SA014w6hKSJ6</loc>
            <lastmod>2026-05-01T16:07:13.322Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ethical-trade-offs-in-model-behavior/3Fnnon3lFcv0C7frpJpT</loc>
            <lastmod>2025-09-28T20:11:34.104Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-policy-optimization-algorithm-uses-a-bounding-function-boundvalue-lowerbound-upperbound-to-constra/3Fq7cafWHhSCpYtzA9JQ</loc>
            <lastmod>2025-09-28T20:01:26.330Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-implementing-a-training-pipeline-for-a-large-language-model-using-human-feedback-and-a-spe/3GHfUlsra79UqIqvd39j</loc>
            <lastmod>2025-10-05T21:42:03.722Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-aligning-a-language-model-using-a-technique-that-learns-directly-from-a-large-sta/3H3kbTCm8ejdPU1ZJEnQ</loc>
            <lastmod>2025-09-28T23:31:40.099Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-conditional-log-probability/3HVP0nJqylznKxHUU3AH</loc>
            <lastmod>2025-10-02T02:09:22.551Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-optimization-derivation-step/3L7k4m6gcmdWsryVRvkR</loc>
            <lastmod>2025-10-08T21:36:13.140Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-preparing-a-dataset-for-a-machine-translation-fine-tuning-task-the-most-effective-initial-actio/3LoNpAOsndI6toyngA6i</loc>
            <lastmod>2025-10-04T09:01:40.956Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-is-experiencing-a-technical-problem-where-their-laptop-frequently-disconnects-from-their-home/3LyVYbcM92ShUcHpafxY</loc>
            <lastmod>2025-10-09T03:53:21.645Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-information-flow-in-a-system/3MTZ2VN5CzWVPJgfzkwZ</loc>
            <lastmod>2026-06-30T07:51:32.715Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/application-of-ac-in-rlhf-for-llm-alignment/3OodXVoITLq97kc9Jeyy</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/penalty-based-trust-region-implementation/3QHOaUzdzVmdPthRtJg1</loc>
            <lastmod>2025-10-10T10:32:24.436Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-the-reward-model-optimization-objective/3QIIDgPG0AukoiydmYTW</loc>
            <lastmod>2025-10-03T21:51:56.810Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sft-data-strategy-for-a-fintech-startup/3SiGobWcbK3IYajWx8Og</loc>
            <lastmod>2025-09-26T07:20:46.648Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-in-a-state-where-the-expected-return-averaged-over-all-possible-actions-according-to-its/3TKFt3jSQz6RbbZVBSok</loc>
            <lastmod>2025-10-07T08:19:47.703Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/token-level-representation-of-input-and-output-sequences-for-a-forward-pass/3UokA4YMHB8BiNmZFJHB</loc>
            <lastmod>2025-10-09T00:55:16.643Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-powerful-language-model-a-strong-model-for-a-complex-task-to-guide-i/3WeXgHW1v4UdcOW4zUR1</loc>
            <lastmod>2025-10-03T18:32:22.137Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-using-an-actor-critic-method-where-the-actors-loss-is-the-negative-of-the-/3X0wUweOF8NznC8ZOc61</loc>
            <lastmod>2025-10-04T04:57:51.508Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-the-sufficiency-of-prompting-in-llm-adaptation/3ZTpSbqKShm3iBXmSYAp</loc>
            <lastmod>2026-04-29T04:19:13.689Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-adapting-a-large-pre-trained-language-model-for-a-new-text-classifica/3Zk3STcAkIBDUQ4s4jSf</loc>
            <lastmod>2026-04-29T03:51:54.463Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-future-return/3ZttqQGH9mQmehqK4d2J</loc>
            <lastmod>2025-10-09T00:29:22.445Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-using-a-dataset-where-each-entry-consists-of-a-prompt-a-preferred-re/3d1PJIyBMC2RRWvBi4ou</loc>
            <lastmod>2025-10-05T20:52:17.498Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/adapting-a-model-for-a-new-task/3hF3OxY5XFe675goaVoD</loc>
            <lastmod>2025-10-05T20:18:09.171Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/trajectory-generation-as-a-markov-decision-process/3hU5SHFjwL4uZaxoZlJd</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/scoring-reasoning-paths-by-counting-correct-steps/3hXITefYfq83czOxRrU4</loc>
            <lastmod>2026-05-03T15:07:38.713Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-training-implementations-for-multi-round-dialogue-models/3iwYIy4jwXenNFNkjka1</loc>
            <lastmod>2026-05-01T00:25:07.215Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-computational-demands-of-fine-tuning/3jvHCvsDTO87qkDcKSOH</loc>
            <lastmod>2025-10-06T17:54:52.912Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-fine-tuning-strategy-for-sequence-summarization/3kYY4mjygvTJO4nAr2hm</loc>
            <lastmod>2025-10-02T11:41:31.125Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-selection-and-prompt-strategy/3miJK76YVEqWufu1Vh61</loc>
            <lastmod>2025-10-02T21:11:39.505Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-specific-prompting-technique-uses-a-models-own-computational-layers-to-progressively-improve-a-set/3nAVwWNXNYh4pXePDg9g</loc>
            <lastmod>2025-10-05T22:15:11.825Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-realization-that-large-pre-trained-language-models-could-be-effectively-guided-to-perform-new-ta/3pl53sp6BRcRtfXkw6cm</loc>
            <lastmod>2025-09-29T03:26:28.104Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-wants-to-use-a-large-language-model-to-determine-if-incoming-emails-are-unwanted-which-o/3qXruz6HnQKBB1VU7NEk</loc>
            <lastmod>2025-09-28T13:40:01.484Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dataset-selection-for-model-fine-tuning/3qqINiDMfkLMbYTHfUkY</loc>
            <lastmod>2025-09-26T12:14:41.680Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-an-initial-step-in-a-generated-technical-solution/3sPBcB5OqhN49qhpu6s4</loc>
            <lastmod>2025-10-09T00:59:41.630Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-using-an-automated-process-to-expand-a-collection-of-instructional-tasks-starting-from-a-s/3uRXwarXUcM1uUPWTLdb</loc>
            <lastmod>2025-10-07T00:03:42.274Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-mathematical-notation-with-the-process-it-accurately-describes-in-these-notations-s-repre/3ucDBu5n7TMVha0CfXF5</loc>
            <lastmod>2026-06-29T00:10:07.011Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-an-effective-problem-solving-prompt/3uiAycQS0QwGc3yXBas7</loc>
            <lastmod>2025-10-04T17:35:59.783Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-llm-is-provided-with-a-compressed-representation-of-context-denoted-as-and-an-input-z-the-models-/3vPG4lApzNQhnQxinsAU</loc>
            <lastmod>2026-07-03T23:21:45.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-undesirable-agent-behavior/3wZLsB2gn61wbLRNviQB</loc>
            <lastmod>2025-10-06T00:43:14.481Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-using-a-policy-gradient-method-the-theoretical-objective-gradient-is-expre/3wtL3XD8Lkqd1lF8rBcT</loc>
            <lastmod>2025-10-04T04:13:13.889Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-an-erratic-training-process/3zHGkRGGbjrPEPSlNgaA</loc>
            <lastmod>2025-10-07T08:59:18.275Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-input-preparation/428DHVC2clZYzMpV2LCS</loc>
            <lastmod>2025-10-05T22:07:25.605Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-startup-is-developing-a-specialized-chatbot-for-financial-advice-to-improve-its-performance-they-i/42H10CvJhK25cwc4GWTL</loc>
            <lastmod>2025-10-10T06:03:01.137Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-law-firm-wants-to-develop-a-language-model-that-can-take-a-lengthy-legal-contract-as-input-and-pro/44HGkiU3ZR6Dkg0Vwe1G</loc>
            <lastmod>2025-10-10T05:11:23.830Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-scaling-strategies-for-model-generalization/45v0lwwoXgkPHmYTv9bJ</loc>
            <lastmod>2025-10-06T12:55:16.242Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/model-initialization-strategy-in-rlhf/46g8JNEzN6i6CnPnTqpE</loc>
            <lastmod>2026-05-02T23:24:02.257Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-signal-transformation-in-a-sequential-task/48Q20Juhkvm3g3RluT3r</loc>
            <lastmod>2025-10-10T05:42:14.811Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-with-the-objective-of-modeling-the-joint-probability-of-a-combined/48j4bGbzSWyt7l19kQDN</loc>
            <lastmod>2025-10-06T23:12:19.068Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-condition-for-a-model-to-demonstrate-intra-task-generalization-is-expressed-by-the-formula-fracz/4ApPu6zeSm7vEPCK5bHx</loc>
            <lastmod>2026-05-01T10:46:39.251Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-collection-strategy-for-an-ai-coding-assistant/4B28g8yMxIBgpVPCuzfd</loc>
            <lastmod>2025-10-05T21:09:52.467Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-student-model-performance/4BBm2zXxevRIgjRTgEl3</loc>
            <lastmod>2025-10-04T01:59:21.481Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-reward-score-difference/4BJ1YqGAMVxPnMHlcIRm</loc>
            <lastmod>2025-10-08T22:02:33.628Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-objective-for-fine-tuning-a-pre-trained-model-is-formally-expressed-as-tildeomega-tildetheta-arg/4EotaOBjYjArQUR9b4h8</loc>
            <lastmod>2026-04-29T03:51:54.561Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-based-language-model-alignment-process-the-reward-rx-y-for-a-response-y-to-a-prompt-x/4GYFv9e0rH7bIXP9O94E</loc>
            <lastmod>2025-09-28T11:50:19.088Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-the-baselines-effect-on-policy-gradient-expectation/4Gya7kbPdsJDHaHqZME8</loc>
            <lastmod>2025-09-28T20:41:00.232Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-optimization-process-a-penalty-is-used-to-measure-the-change-between-a-current-policy-pi/4NlaCPA84ojr2codQljq</loc>
            <lastmod>2025-10-02T03:09:03.763Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-feedback-for-a-multi-step-reasoning-task/4O2WmF8CYMeToIabjHoL</loc>
            <lastmod>2025-09-26T08:33:34.901Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-reward-model-training-issues/4PDX55FwiPjKWPTzccbj</loc>
            <lastmod>2025-10-04T05:26:38.483Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/instruction-following-ability-of-llms/4PvVZYrCYhrtjjYvLK7H</loc>
            <lastmod>2026-01-15T02:53:22.735Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-primary-motivation-for-using-computational-methods-to-automatically-generate-instruction-fine-tu/4UmpN85Utxaeirx5Rcx8</loc>
            <lastmod>2025-10-05T21:44:20.672Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-process-that-uses-human-feedback-a-reference-model-with-a-fixed-set-of-p/4XFu6ii7JJFdhslAbvqq</loc>
            <lastmod>2025-09-26T05:04:34.691Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-trains-a-reward-model-using-a-pointwise-method-where-human-annotators-assign-an-absolute-qual/4Y0k9lnkTQV0tFIWjqgi</loc>
            <lastmod>2025-10-02T19:48:47.608Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sum-of-past-rewards-notation/4Z6oBZ9myd4PIPorGJRt</loc>
            <lastmod>2026-07-01T13:12:58.490Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/trade-offs-in-data-curation-for-model-training/4bG2Liog26bntSmfYFoJ</loc>
            <lastmod>2025-10-10T06:00:54.343Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-completes-an-episode-of-time-steps-receiving-the-following-sequence-of-rewards-r-r-r-r-when/4cWp3VMJU7dBPMMZlkh2</loc>
            <lastmod>2025-10-07T09:09:20.829Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consequences-of-an-incorrect-loss-function-implementation/4cY8me1JwXiso14vOW3C</loc>
            <lastmod>2025-10-08T15:43:04.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-model-specialization/4fLfZGAADzrKvykObyHZ</loc>
            <lastmod>2025-10-08T12:46:09.192Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-diagram-shows-a-cascading-model-workflow-where-an-input-is-first-processed-by-a-small-cheap-model-/4h8Az15XqbyvxlPjND7l</loc>
            <lastmod>2025-10-09T01:39:10.711Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/clipped-utility-function-with-upper-bound-clipping/4hUmJzixvd07X14sYnZg</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-value-function-training-issues/4ilObZpBqRtwcwWRai8e</loc>
            <lastmod>2025-10-08T22:38:22.722Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-preparing-a-large-dataset-to-train-a-model-specifically-for-english-t/4oIvFjcGKlMIbwkgYht6</loc>
            <lastmod>2026-04-19T20:35:04.310Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-actions-performance/4oJT57e7Lzp6KiIvbZ8W</loc>
            <lastmod>2025-10-07T08:09:18.455Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-an-rlhf-training-blueprint-for-a-regulated-customer-support-llm/4r7YHa1rXUojIk7lwCjV</loc>
            <lastmod>2026-02-06T17:53:36.698Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-data-sourcing-strategy-for-a-specialized-ai/4tH4wumgVYVR9XL0BHWO</loc>
            <lastmod>2025-10-10T03:08:53.599Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-customer-feedback-for-a-smartphone/4tQo1IuPZlnydhlDb1sW</loc>
            <lastmod>2025-09-28T12:04:30.365Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-a-translation-prompt/4vq4K9olp34zjilIGLmp</loc>
            <lastmod>2025-10-04T22:20:02.423Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/gono-go-decision-for-an-internal-llm-safety-bias-privacy-and-refusal-behavior/4wbK5ocZ5VETr2rmJsh4</loc>
            <lastmod>2026-02-06T18:24:34.061Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/simplifying-prompt-text-for-efficiency/4wgse6oZN9ey9J0uEw5q</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-asks-a-large-language-model-summarize-the-arguments-for-and-against-using-genetically-modifie/4ycOrAuA2UufW5SIt50Y</loc>
            <lastmod>2026-04-29T04:19:19.414Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-and-justifying-dpo-vs-rlhf-for-preference-alignment-under-operational-constraints/51p5OtMQqIQ53e9YwOhF</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-preference-model-output/51wRFTzyPcaqGaTeaDDo</loc>
            <lastmod>2025-10-08T14:29:03.391Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/emergence-of-prompt-engineering-as-a-research-field/541W6bYvp4XMgnl2EfKn</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-is-documenting-the-memory-subsystem-of-a/55FWSZg7NIoPmP3hTu2A</loc>
            <lastmod>2026-02-06T18:31:53.916Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/goodharts-law/567uTVcpP7hEGMmaE5Ob</loc>
            <lastmod>2026-02-08T13:31:50.952Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-flawed-reward-shaping-implementation/56puJBUbiUNhgtGuz7W2</loc>
            <lastmod>2025-10-04T01:37:29.676Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-function-invariance/57yKQgdIjLDDrK0ISzHe</loc>
            <lastmod>2025-10-08T20:14:18.559Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-feedback-collection-for-a-chatbot/5EqvRFw6mmV2qGPNI3KR</loc>
            <lastmod>2025-10-05T21:35:55.408Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-task-where-text-segments-are-classified-as-aligned-represented-by-or-misaligned-represented-by-/5HPNeeUMuiZsS6MJ4wEz</loc>
            <lastmod>2025-10-07T09:18:01.124Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/score-function-in-policy-gradients/5Hp3cRZ2vgb9ENsqpK0L</loc>
            <lastmod>2026-06-28T01:04:33.207Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-llm-performance-on-multi-step-problems/5IcGEjiiBvk2AEeLlwXm</loc>
            <lastmod>2025-10-02T23:54:42.707Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/weak-to-strong-generalization-via-fine-tuning-on-weak-model-data/5KP7uuFSTddyWDny6b17</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-fine-tuning-dataset-strategy-for-a-coding-assistant/5M0JTklXoWBl8SBJ7GzI</loc>
            <lastmod>2026-02-08T14:40:18.528Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-an-older-text-classification-system-designed-to-determine-if-a-movie-review-is-positive-or-/5NmYc0OhlI3w68VfVnYz</loc>
            <lastmod>2025-09-26T10:05:32.658Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-using-a-reinforcement-learning-objective-for-each-generated-token-/5O9qS2itcONduTvKmWZ5</loc>
            <lastmod>2025-10-08T15:07:43.349Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-fine-tuning-a-language-model-using-a-reinforcement-learning-process-in-each-step-the-model/5OtNCg8d1BIZS1uAM9Z5</loc>
            <lastmod>2025-10-03T02:26:10.320Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/flexibility-of-ranking-loss-functions-in-reward-model-training/5P5xFoOwgXWRkYz0ELsZ</loc>
            <lastmod>2026-05-01T18:04:57.482Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-alignment-of-a-language-model-using-a-preference-based-optimization-method-a-crucial-assu/5S9vPr98X6HCNe7uQYYp</loc>
            <lastmod>2025-09-28T22:32:57.510Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/unnormalized-target-distribution-in-the-dpo-objective/5SQgjOSPCTuu5PCWGnew</loc>
            <lastmod>2026-05-03T00:44:36.043Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-policy-gradient-methods-the-gradient-of-the-performance-objective-is-estimated-as-an-expectation-/5T9YFfUUKEppb7XE6HEF</loc>
            <lastmod>2025-09-28T19:33:29.024Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-the-soft-prompt-optimization-formula/5X2H6um5qHRE78kkpKTr</loc>
            <lastmod>2025-10-04T02:33:04.969Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/synthetic-data-as-supervision-signals-in-advanced-fine-tuning/5Y7YCHK8r9ZpxgXuIoNn</loc>
            <lastmod>2026-05-01T10:20:28.247Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-flawed-llm-training-strategy/5cxm22Xaio5h40g8TgCW</loc>
            <lastmod>2025-10-02T23:49:26.899Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-training-a-language-model-to-write-a-multi-paragraph-summary-of-a-document-providing-a-reward-a/5e5RLuslz5bSyKGTNtER</loc>
            <lastmod>2025-10-06T19:10:58.035Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-of-ai-developers-is-refining-a-language-model-using-a-dataset-of-human-preferences-each-data-/5iEy6frWzdB0oSjzBH9C</loc>
            <lastmod>2026-06-26T22:34:00.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/complexity-of-generalization-due-to-instruction-and-input-variation/5ieCG5L6rv6yUtBzHFP7</loc>
            <lastmod>2026-05-01T10:53:10.502Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/notation-for-parameters-in-the-fine-tuning-process/5lKC0VGAFF04ZdUsY6Bs</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimal-policy-parameters-via-maximization-formula/5lexQh2YZFHxB1gla5fy</loc>
            <lastmod>2025-10-08T14:56:47.224Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-pre-training-strategies-for-specialized-ai/5m04jfCgsBIZCDRimeEv</loc>
            <lastmod>2025-10-06T21:22:55.228Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/supervised-fine-tuning-sft/5p6qvO5lh0Dc7F92NDq9</loc>
            <lastmod>2026-04-30T23:40:53.795Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/granular-feedback-analysis/5pP1jUaWvVp70zCjZYf0</loc>
            <lastmod>2025-10-07T09:04:46.076Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-models-policy-which-determines-the-probability-of-generating-an-output-y-given-an-input-x/5rd0DBVcAUYBiHitjxZP</loc>
            <lastmod>2025-09-26T12:22:38.903Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prompting-as-a-form-of-inference-time-alignment/5vYKt2aFWfhPsYbFCmNn</loc>
            <lastmod>2026-02-08T13:19:54.077Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineering-team-is-refining-a-large-language-model-during-one-step-of-the-process-the-model-is-g/5vrwjAOhtpd8rQMVcIHr</loc>
            <lastmod>2025-09-29T00:39:25.261Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/step-level-annotation-by-human-experts-for-process-supervision/5vyD7Cwrmg0Ob7nX10lQ</loc>
            <lastmod>2026-06-25T22:24:27.250Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-llm-training-instability/5wc3CP2qaKLwLckXZHgS</loc>
            <lastmod>2025-09-26T05:20:48.865Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-normalization-factor-cancellation/5xpi5AWwAUPSFUmrvOnx</loc>
            <lastmod>2025-10-07T01:06:25.951Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-model-is-being-trained-to-generate-outputs-its-behavior-is-described-by-a-probabi/61pLs1nlSAgjla7ZfKxl</loc>
            <lastmod>2025-09-26T09:46:10.882Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/self-driving-car-policy-update-analysis/63XIzA5wDL0dZcrGYqM1</loc>
            <lastmod>2025-10-08T14:31:29.110Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-generates-a-three-segment-response-to-a-users-prompt-a-separate-reward-model-evalua/64LeZp9Cgr4J1sVCI5UL</loc>
            <lastmod>2025-10-02T02:11:37.396Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-aims-to-create-a-helpful-technical-support-chatbot-they-train-a-general-purpose-l/64Xxp9ju48kQfG03FiAZ</loc>
            <lastmod>2026-02-08T13:55:03.452Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/simplification-of-the-trajectory-log-probability-gradient/64fiuTOhseLQsUqkGdFK</loc>
            <lastmod>2026-05-01T16:24:04.273Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/instruction-data-generation-and-collection/65WqwUBqRaIRjoIwEsQ3</loc>
            <lastmod>2026-01-15T02:59:43.695Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-synthetic-data-for-niche-domain-pre-training/68GY9kmRr6uYpSlHgpio</loc>
            <lastmod>2025-10-06T22:52:45.329Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/primary-source-of-out-of-distribution-generalization-pre-training-vs-fine-tuning/6C1HiVjrl7suEBA2KB16</loc>
            <lastmod>2026-05-01T14:37:47.142Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/text-simplification-as-a-sequence-to-sequence-task/6E73ezCxzNouE0NSGQEw</loc>
            <lastmod>2026-04-30T22:48:01.667Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-creates-a-reward-model-for-a-customer-service-chatbot-that-perfectly-captures-all/6EsJgw35zz47W3dVO1RE</loc>
            <lastmod>2025-10-07T10:03:33.871Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-policy-optimization-objective-can-be-shown-to-be-equivalent-to-minimizing-a-kl-divergence-arrange-/6G69JxClga9e86EzXozA</loc>
            <lastmod>2025-10-04T02:45:56.106Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-process-a-new-policy-defined-by-parameters-is-evaluated-using-an-objecti/6GZmUBcrNKS1HAejZfMv</loc>
            <lastmod>2025-09-28T12:24:09.791Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-an-ai-performance-metric/6JoD62lmijJmFaIOUsQc</loc>
            <lastmod>2025-10-03T19:26:57.233Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/increased-action-probability-condition/6K76qTUqNwJsyqIFdpgu</loc>
            <lastmod>2026-06-29T21:01:57.589Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-segment-notation/6KDH5R8WlkP17UNR8BvM</loc>
            <lastmod>2025-10-04T02:12:49.415Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-flawed-agent-behavior/6KTZu7QIqfKoEr9SxDLt</loc>
            <lastmod>2025-10-02T02:42:05.099Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-large-language-model-to-act-as-a-technical-support-chatbot-to-cr/6QaFmHck5bG2NuH5OagL</loc>
            <lastmod>2025-10-02T10:46:44.477Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reference-policy-definition-in-rlhf/6TUSTK2fXvKEZ8Ss6s0I</loc>
            <lastmod>2026-06-23T20:38:39.008Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-the-product-owner-for-a-customer-support-l/6V9nQYf11McBpZwxn34c</loc>
            <lastmod>2026-02-06T18:26:46.191Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-training-a-reward-model-to-align-with-human-preferences-the-objective/6W91TX1bmGzv971PLUkc</loc>
            <lastmod>2025-09-26T12:26:23.397Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-framework-for-aligning-language-models-a-reward-function-is-defined-as-rmathbfx-mathbfy-beta-le/6WuKlBXuuCj6ISWWCRfi</loc>
            <lastmod>2025-10-04T01:38:30.108Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-training-data-for-a-medical-language-model/6ZHCAPFzXLzuEVpBQsb8</loc>
            <lastmod>2025-09-26T02:11:56.975Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-using-a-pre-trained-large-language-model-to-build-a-chatbot-for-customer-suppo/6a7nAyeSPkfEVetZetjd</loc>
            <lastmod>2025-10-06T18:32:22.288Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-has-a-powerful-general-purpose-language-model-that-was-trained-on-a-vast-unlabeled-co/6cIy8ehgr4XjnOUUXQwB</loc>
            <lastmod>2025-09-28T15:36:11.055Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-aligning-a-new-large-language-model-to-be-helpful-and-non-discriminatory-during-testing/6chXgKokY6DKgs3VqDvM</loc>
            <lastmod>2025-10-02T22:10:53.181Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-learning-a-task-using-a-policy-update-rule-defined-by-the-following-equation-where-atst-/6dN3T4kuN5ixQzNSn1Gt</loc>
            <lastmod>2025-09-26T11:19:03.074Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-aims-to-align-a-large-language-model-to-be-more-helpful-they-create-a-dataset/6eNkC8HRdle96SaAIsCJ</loc>
            <lastmod>2025-10-01T20:54:57.625Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-common-fine-tuning-strategy-a-prompt-and-its-desired-completion-are-concatenated-into-a-single-/6fFBT4y9KDI621Uc3D6u</loc>
            <lastmod>2025-09-29T12:31:05.308Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/visual-diagram-of-weak-to-strong-generalization-via-data-selection/6gFl6ikR1D0qpr2vmIAA</loc>
            <lastmod>2025-10-09T01:13:21.238Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-language-model-state-evolution/6htMWQ8S85TxkcIsGaIY</loc>
            <lastmod>2025-10-04T16:15:33.295Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/managing-the-prompt-creation-process/6jg9z2fVq3throZJyYY2</loc>
            <lastmod>2026-05-01T01:04:49.105Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-develops-a-large-language-model-pre-trained-on-a-massive-diverse-corpus-of-text-from-the-inte/6kU1c87I59SrtrwK90IB</loc>
            <lastmod>2025-10-01T20:00:17.878Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-fine-tuning-optimization-strategies/6kedEe9QIsV7hg360y3V</loc>
            <lastmod>2025-10-02T20:17:43.875Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/multi-round-prediction-problem/6klP3gMYteeWOnV8QzgX</loc>
            <lastmod>2026-05-01T00:17:08.117Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/average-value-notation-bary/6kn00ur0pViSilVXczc6</loc>
            <lastmod>2026-07-04T00:11:54.724Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fatigue-as-a-symptom/6l1adTftinAophsWDdhr</loc>
            <lastmod>2026-04-15T00:26:05.913Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-a-negative-reward-function-rmathbfx-mathbfy-barmathbfy/6lfLlYYYVZwQx94G1mot</loc>
            <lastmod>2026-06-26T06:35:32.733Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-faulty-fine-tuning-process/6m8Cvm0M7YBOA0gTayJr</loc>
            <lastmod>2025-10-06T22:45:52.716Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-constructing-a-prompt-to-teach-a-language-model-a-new-task-by-providing-examples-dire/6oTembEVhbB5mraQ2Gjb</loc>
            <lastmod>2026-04-29T04:14:31.773Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/specification-gaming-in-ai-alignment/6pRfPv7ffDrBgP72b7MI</loc>
            <lastmod>2026-05-03T15:48:30.644Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-models-policy-pitheta-is-being-updated-by-minimizing-the-loss-function-mathcalltheta-math/6rcfAlUezhgdlob5hOdn</loc>
            <lastmod>2025-09-28T20:27:48.396Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-context-compression-for-a-specialized-task/6ruCS2O4nzkthPSBg6lh</loc>
            <lastmod>2025-10-03T04:41:47.396Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/post-incident-review-memory-design-for-long-running-customer-support-chats/6uJLGdQL4TkNoMLngwKj</loc>
            <lastmod>2026-02-06T18:31:06.361Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/explaining-dpos-objective-as-offline-rl-without-a-reward-model-a-pipeline-and-math-based-justificati/6wBUbCFN6YJjGhVw3YOO</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ppo-objective-formula-for-llm-training-in-rlhf/6x0Jhip1xYy6HWfYGzOi</loc>
            <lastmod>2026-07-03T01:17:11.026Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/effect-of-temperature-parameter-on-reward-weighted-distributions/6xJa47da6QGqf0hBVZSJ</loc>
            <lastmod>2026-06-20T19:07:10.129Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-integration-strategy/6xpwTPorSzgtEiONtW1D</loc>
            <lastmod>2025-10-02T07:17:48.284Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-training-a-language-model-for-a-highly-specialized-field-such-as-quantum-physics-/6yvGaVqBuqUoTp2R5bZ1</loc>
            <lastmod>2025-10-03T02:26:58.737Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-policy-gradient-updates-for-text-generation/6zxkR2Do1d1J22XaJa8q</loc>
            <lastmod>2025-10-04T04:30:52.711Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-data-scientist-is-recording-the-unique-user-ids-of-everyone-who-visited-a-website-on-a-particular-/712oOEx2S2BL7i88trBe</loc>
            <lastmod>2026-06-30T09:58:54.482Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-two-stage-process-where-a-weaker-model-selects-a-data-subset-to-fine-tune-a-stronger-model-th/71TjjEHDwPIUFQ5ulqZN</loc>
            <lastmod>2025-10-06T11:32:42.546Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/healthcare-assistant-chatbot-as-a-multi-round-prediction-problem/747sY7mAIaFEtOmht5Bm</loc>
            <lastmod>2026-05-01T00:26:11.477Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-on-a-preference-dataset-for-a-single-input-prompt-the-ground-truth/75CG9zTJVYCOOvMy0fCt</loc>
            <lastmod>2025-10-03T22:06:15.226Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-training-instability/773YWB6P6iQ4WFUQrqMS</loc>
            <lastmod>2025-10-02T17:58:40.109Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-medical-research-institute-with-a-limited-budget-is-developing-an-instruction-following-dataset-to/7AjGVZgCb7A1gtupD0Ad</loc>
            <lastmod>2025-10-02T08:26:58.289Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-a-conversational-failure/7Cx3RwiuWqn6uEt72Bpt</loc>
            <lastmod>2025-10-03T06:01:39.876Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-preference-modeling-approaches/7EKirdNrvQ6nazofdo0b</loc>
            <lastmod>2025-10-03T02:27:46.323Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-agents-action-choice/7EbUVfhlWAL3FqUvmHCS</loc>
            <lastmod>2025-10-08T23:58:33.211Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-a-simplified-objective-function/7KY8T3anP35rKVCw29mQ</loc>
            <lastmod>2026-06-26T15:39:47.223Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-preparing-a-large-dataset-of-user-comments-to-train-a-powerful-classification-model-to-ens/7Nf25jBKrGCmYDCuET9k</loc>
            <lastmod>2025-10-02T04:16:54.891Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-singular-alignment-strategy/7PsfnJSxYHXclH4BplQl</loc>
            <lastmod>2025-09-26T14:07:59.425Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-alignment/7StIQwl6xLrbhg8X81qv</loc>
            <lastmod>2026-05-03T15:43:57.003Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-modified-policy-formulation/7W3muFF1YoUtDI5NkzMs</loc>
            <lastmod>2025-10-07T09:13:09.936Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-student-language-model-using-a-combined-objective-that-balances-learning-f/7WEs2VrD3E7ujGBSETuu</loc>
            <lastmod>2025-10-05T21:33:38.412Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-performance-comparison/7WHMxi2g0RQWnXyBIJxb</loc>
            <lastmod>2025-10-08T23:39:52.488Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/multi-task-capability-through-diverse-fine-tuning-datasets/7WpzTNkDhlOPYhOmRDX9</loc>
            <lastmod>2026-02-08T14:11:37.693Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-is-implementing-preference-based-alignme/7Wzs0p8bQRqM1OoA0P5l</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/adapting-a-language-model-for-reward-prediction/7Xd7Wx88V6fMVwDCxYhA</loc>
            <lastmod>2025-10-06T14:22:58.671Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-an-llm-alignment-strategy/7XjoBVYDmi2xcS21v4m3</loc>
            <lastmod>2025-10-02T07:54:41.683Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/invariance-of-preference-probability/7YpYn9n08ejIgEdCjRIk</loc>
            <lastmod>2025-10-09T00:35:20.618Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-implementing-a-reward-model-where-the-final-scalar-score-r-is-computed-from-the-last-/7aKv0ET1he1xdylf77Gr</loc>
            <lastmod>2025-10-08T16:06:20.785Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-function-as-a-form-of-shaped-reward/7aOufgqRNd9ED5OehpFx</loc>
            <lastmod>2026-05-17T20:53:18.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-model-is-being-trained-to-learn-robust-features-from-data-by-reconstructing-an-original-clean-data/7aq0xdBGuWGAQ9XdFSoJ</loc>
            <lastmod>2026-04-29T03:52:01.835Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-holistic-text-evaluation/7ekWErHeN9tozRPrGgzM</loc>
            <lastmod>2026-02-09T19:44:55.565Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-the-advantage-function/7ftjWvpZ0ujYlH13jdyf</loc>
            <lastmod>2025-10-08T22:15:50.564Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/oracle-reward-model-as-an-ideal-solution-to-overoptimization/7hXXjXTz4vkfyOVDlg0q</loc>
            <lastmod>2026-05-03T00:18:32.667Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-paradigms-pre-training-vs-supervised-fine-tuning/7krdARl9LvT4PwfTc9pa</loc>
            <lastmod>2025-10-06T16:57:39.876Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-in-a-state-st-with-an-estimated-value-vst-takes-an-action-this-action/7qjHIr2VXkBBJUDmsC8j</loc>
            <lastmod>2026-05-17T20:53:15.841Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/empirical-pair-wise-ranking-loss-for-rlhf-reward-model/7rlIx9HqDEeuqwqxIARl</loc>
            <lastmod>2025-10-08T15:12:35.865Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-reward-model-ensemble-strategy/7rwgdaLa0Xfd30e0gXh9</loc>
            <lastmod>2025-09-29T03:32:33.016Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/application-of-advanced-reasoning-in-modern-llms/7sGb4GTgAv5rOpggdIdh</loc>
            <lastmod>2026-05-03T15:24:47.768Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-role-of-parameters-in-an-llm-policy/7vLcO02lLyJlZ9JfYp6b</loc>
            <lastmod>2025-10-03T18:21:54.705Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/trade-offs-in-fine-tuning-strategy/7vSYdYUNC0j1YC3YPN77</loc>
            <lastmod>2025-10-10T08:02:16.582Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-reward-model-to-improve-an-ai-that-generates-multi-paragraph-step-by-step-tut/7xUBF59q8OhsPS6josry</loc>
            <lastmod>2025-10-01T18:44:12.935Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/underdetermined-model/82Esf5R5LvtQhvOnwmpD</loc>
            <lastmod>2025-10-07T12:04:16.471Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-learning-to-navigate-a-complex-environment-match-each-of-the-following-questions-the-age/830yaDAID4rK8Bul1Nbd</loc>
            <lastmod>2025-10-02T18:35:43.811Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-large-language-model-for-a-specific-task-using-a-dataset-of-inpu/87JkWyuJ0qQm9QeYVOqG</loc>
            <lastmod>2025-09-28T16:55:25.473Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-dialogue-model-training-strategies/8BYlPthLhQVcF95GKwbz</loc>
            <lastmod>2025-10-09T00:25:51.316Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-ai-alignment-strategy/8CAVzEFXeAbPlte6lldu</loc>
            <lastmod>2025-09-29T12:00:35.481Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/aspect-based-sentiment-analysis-absa/8Dj2Br9sUyrqr7A6KKd2</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-implementing-a-system-where-user-queries-are-first-processed-by-a-small-fast-model-if-t/8DlTHAVt2xVq8IUx6H4P</loc>
            <lastmod>2025-10-05T20:28:47.273Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-language-model-training/8EkLyCJii9aCmfr2wCIM</loc>
            <lastmod>2025-10-05T13:22:04.303Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-reference-model-selection-in-reward-based-training/8F70EdLgqTW7Z2QWypaw</loc>
            <lastmod>2025-10-06T22:29:30.030Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-a-large-powerful-computational-model-is-trained-using-labels-generated-exclusively-by-a-smaller/8GwSCZUduGEdilFgBKaP</loc>
            <lastmod>2025-10-06T13:38:30.879Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-role-of-the-conceptual-reward-model-in-dpo/8JrHFwQR04T0VIdZcJqk</loc>
            <lastmod>2025-10-06T18:15:31.144Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/historical-origin-of-daylight-savings-time/8K0YQQ8E8bVrRyPXWW9h</loc>
            <lastmod>2025-10-05T12:26:43.604Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-soft-prompt-optimization-by-minimizing-prediction-dissimilarity/8MY7f7NVCfE2XJ7CQ525</loc>
            <lastmod>2025-10-08T15:15:47.385Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-evaluating-a-language-models-output-a-function-is-commonly-expressed-as-rmathbfx-y/8MZE5nL8c65Jflw5xxAh</loc>
            <lastmod>2025-10-03T21:56:13.947Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-particular-policy-optimization-framework-the-target-policy-denoted-as-pithetamathbfymathbfx-is-/8PJyLHsSU10dTqNSmtHs</loc>
            <lastmod>2025-09-28T15:33:08.674Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/insufficiency-of-data-fitting-for-aligning-with-human-values/8PW1Mb5AXP7VxtbZNA5J</loc>
            <lastmod>2026-02-08T13:15:02.096Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-information-loss-in-a-sequential-processing-model/8PWkAi3H3QBZhcOuSxcQ</loc>
            <lastmod>2025-10-10T03:46:21.650Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-interacts-with-an-environment-over-an-episode-that-lasts-for-time-steps-from-time-step-to-t/8Pne26qTFkl5pWZBYR5Y</loc>
            <lastmod>2025-10-07T08:23:48.889Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-a-user-provides-a-detailed-set-of-instructions-to-a-large-language-model-to-guide-its-response-/8UMdCKGR3ZDeBZxsdX9r</loc>
            <lastmod>2025-10-06T00:34:41.794Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-a-policy-gradient-update/8UxrnylG0NR4czir0gXB</loc>
            <lastmod>2025-10-02T12:01:15.340Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-selection-and-filtering-methods-for-fine-tuning/8XdrfiRzrLjkWiwxQaGW</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-given-a-task-where-the-instruction-is-summarize-the-following-text-and-the-users/8XqobwOxd5VnxUpiZUVo</loc>
            <lastmod>2025-09-28T14:17:49.938Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-a-two-stage-training-pipeline/8XvFHVruqtKwdyi7aCuf</loc>
            <lastmod>2025-10-09T00:53:50.684Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/goal-of-llm-alignment-accuracy-and-safety/8YeOzxBnhM8NBoouoYFw</loc>
            <lastmod>2026-02-08T13:12:01.735Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-text-generation-model-where-a-single-quality-score-is-assigned-only-after-a-com/8aTdBoABlZXnfZ7WfEGn</loc>
            <lastmod>2025-09-29T01:43:48.744Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-a-prompt-for-news-article-categorization/8aTvXW3zvCn3Uo99n8kY</loc>
            <lastmod>2025-10-06T03:32:29.812Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/postmortem-long-document-qa-failures-under-fixed-window-vs-compressive-memory/8c6Npvbg9uCC8X2vPxMw</loc>
            <lastmod>2026-02-06T18:31:25.803Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-the-supervised-fine-tuning-objective/8dFNZWsz8GCc9epWvQXu</loc>
            <lastmod>2025-10-04T03:10:55.505Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-misalignment-in-instruction-following/8gQc7Q7eTDXfDPVBQGJq</loc>
            <lastmod>2026-05-01T15:33:14.028Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-training-data-for-a-specialized-chatbot/8h2aGipqAaNWfriUySCr</loc>
            <lastmod>2026-02-08T13:55:07.151Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/combined-training-objective-formula-for-knowledge-distillation/8hCOuto2yok81bJZXlYS</loc>
            <lastmod>2026-05-01T15:43:44.382Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-data-for-a-sentence-level-fact-checker/8iC8bN0Gse4pZAhmOF4Q</loc>
            <lastmod>2025-10-05T22:03:46.827Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-action-quality/8jZAT7gZt4T1vnPoyPyG</loc>
            <lastmod>2025-10-08T15:58:55.294Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/justifying-data-sourcing-strategy/8jmTJmzfKuR447D6aw41</loc>
            <lastmod>2025-10-09T03:24:56.534Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-an-llms-incorrect-prediction/8kLRo9R3NoHdaVgNtdVM</loc>
            <lastmod>2026-07-03T23:21:45.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/true-or-false-the-mathematical-equivalence-between-minimizing-cross-entropy-loss-and-maximizing-the-/8kOBy4mPFz8q3EjAWQpn</loc>
            <lastmod>2025-10-06T00:44:44.816Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-training-a-model-to-score-the-quality-of-text-responses-the-training-data-consist/8kPfgFcqlOb5D2tirF0R</loc>
            <lastmod>2025-09-26T05:58:53.953Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-with-samples-that-follow-a-specific-three-part-structure-analyze-t/8kd9qcYZ8TIydjaVeNBA</loc>
            <lastmod>2025-10-03T06:27:36.612Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-flawed-prompt-optimization-implementation/8kpyQfQyIe32PEHTG95k</loc>
            <lastmod>2025-10-10T06:52:10.290Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-refining-a-language-model-using-human-feedback-for-a-specific-user-prompt-the-model-genera/8lMq5BhI4ZUfM8wjQksZ</loc>
            <lastmod>2025-09-28T15:16:14.396Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-claim-of-perfect-model-alignment/8lak4V3MKzy0Tg4iZgGw</loc>
            <lastmod>2025-10-06T03:08:19.496Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-large-language-model-adaptation-technique-with-the-statement-that-best-describes-its-core/8m9LBEqT8vPiCMTOf9Rh</loc>
            <lastmod>2025-10-06T00:27:56.579Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-building-a-specialized-chatbot-to-provide-users-with-reliable-legal-information-to-crea/8mqC7eic34GHPARkuVIc</loc>
            <lastmod>2025-09-26T06:29:49.318Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-training-a-reward-model-where-human-annotators-assign-an-absolute-qua/8noQKY9STl9rBNfF0pL3</loc>
            <lastmod>2025-10-04T04:34:48.770Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-sampling-strategy-for-instruction-generation/8oJF8uglEHNiOHiaJV8g</loc>
            <lastmod>2025-10-05T22:05:14.107Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-performance-metrics-notation/8opayc6wzXfNENco57JF</loc>
            <lastmod>2026-07-04T00:11:54.724Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-an-underdetermined-reward-model/8q1i8f1etszGFfJ2qSGq</loc>
            <lastmod>2025-10-10T07:09:57.305Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-chatbot-response-quality-without-retraining/8qkQlegMqEsWYbVwiyGN</loc>
            <lastmod>2025-10-01T22:12:35.010Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-startup-with-a-limited-budget-is-building-a-specialized-llm-for-a-niche-rapidly-evolving-domain-li/8qkcAH1r6TV2DgJDmFS5</loc>
            <lastmod>2025-10-01T20:31:40.537Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-fine-tuning-strategies-for-general-purpose-llms/8rSi4mIW4z5lSwrTN8Gt</loc>
            <lastmod>2026-02-08T14:06:08.653Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/parameter-efficient-fine-tuning-as-soft-prompt-learning/8rfGkVUMrGIwITGrInNr</loc>
            <lastmod>2026-05-01T00:48:26.569Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-submits-the-following-prompt-to-a-large-language-model-provide-a-step-by-step-guide-on-how-to/8smAMSdN5KXPMTRnMCk0</loc>
            <lastmod>2025-10-04T16:48:18.682Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/refining-a-summarization-prompt/8sxoNNSkOWuQJrPTJ8gc</loc>
            <lastmod>2025-10-09T00:41:37.948Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-optimization-method-a-composite-objective-function-is-used-defined-as-objective-clippeds/8twsHIzyEiw1Z0qttZvF</loc>
            <lastmod>2025-10-07T08:16:46.613Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-contextual-influence-on-llm-predictions/8vCYhesAtu2HJrJEcow8</loc>
            <lastmod>2025-10-08T16:55:23.986Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-model-training-with-flawed-data/8vPyi6rH9ZZRrykxXP7l</loc>
            <lastmod>2025-10-04T04:32:12.931Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-goal-of-context-compression-for-soft-prompts/8vZp6ss6vfbrCv8tlSVP</loc>
            <lastmod>2025-10-07T10:49:22.604Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-aligning-a-new-language-model-they-decide-to-use-a-large-general-purpose-pre-existing-mode/8xpcNue8f3T9LFNQOOw1</loc>
            <lastmod>2025-10-07T00:24:30.611Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/bootstrapping-llms-with-self-instruct-from-a-seed-dataset/92laRlVJefeSwvGGJNod</loc>
            <lastmod>2026-05-01T10:21:04.125Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-chatbot-for-multi-turn-conversations-they-have-a-dataset-of-k-round-dialogues/93FE146pqHsrLSo4TOnP</loc>
            <lastmod>2025-10-02T02:59:57.119Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-performance-gains-in-model-training/94k5WenLdDJzLIfDglo3</loc>
            <lastmod>2025-10-07T11:46:52.147Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-agent-is-being-trained-to-play-a-video-game-the-training-process-aims-to-increase-the-likeliho/95Faw9jwyPdBtYf60LOm</loc>
            <lastmod>2025-10-09T00:31:17.071Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reasoning-for-objective-simplification/95ciWw1tJSZW4VUV66JZ</loc>
            <lastmod>2025-10-04T01:43:59.789Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/visual-diagram-of-soft-prompt-training/96MJ0Qa6iyYMsZLNetmd</loc>
            <lastmod>2025-10-09T01:22:36.567Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-intermediate-mistakes-in-reasoning-tasks/97KtpEZ8y6VIFzIJ3Xys</loc>
            <lastmod>2026-05-03T01:19:00.107Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sparse-rewards-in-nlp/97OSwD8WSJZWSNrp4TRQ</loc>
            <lastmod>2026-05-02T23:48:28.758Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-wants-to-use-a-large-language-model-to-expand-a-dataset-of-task-instruct/99XzURQt7RzwTGonTYgz</loc>
            <lastmod>2025-10-05T17:19:39.399Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/value-function-loss-in-rlhf/9BNqxI61YIgdDVURubGk</loc>
            <lastmod>2026-06-19T18:15:17.059Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-reward-model-score-outputs/9Fh5JUoM9puzrVb8iPyV</loc>
            <lastmod>2025-10-06T03:52:48.474Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-flawed-prompt/9G6ccbWHwu3eU3HwFevA</loc>
            <lastmod>2025-10-05T17:45:19.186Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fixed-length-segmentation-for-reward-modeling/9GyckcS2QIPK8LR4VFFr</loc>
            <lastmod>2026-05-03T00:16:42.197Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-refining-a-large-general-purpose-text-corpus-to-train-a-specialized-language-model-they-us/9HZYXfsaWzAgg0OE7TQP</loc>
            <lastmod>2025-10-02T22:25:04.636Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-policy-optimization-stage-of-training-a-large-language-model-an-engineer-observes-that-th/9IVUeRzo9XWyau06d2cC</loc>
            <lastmod>2025-09-28T14:44:03.502Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generating-fine-tuning-data-with-crowdsourced-questions-and-llm-generated-answers/9KrMko4ZAW9dfDQQWN5z</loc>
            <lastmod>2026-05-01T01:12:26.155Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-curation-strategy-for-a-medical-imaging-model/9M2RIE8J0OjZ7Y7b19XQ</loc>
            <lastmod>2025-10-05T21:43:38.124Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-uses-a-two-step-process-to-generate-image-captions-the-diagram-for-this-process-shows-an-in/9NIIHHodVHV97A6R2vez</loc>
            <lastmod>2025-10-10T02:18:07.629Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-flawed-fine-tuning-strategy/9NK8htTmhgrR8b6uNj4w</loc>
            <lastmod>2025-10-02T06:39:28.778Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-asymmetry-in-soft-prompt-optimization/9NhHSvECYZnua7YmbkhW</loc>
            <lastmod>2025-10-08T16:50:53.058Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-optimizing-an-agents-behavior-at-a-specific-time-step-t-the-quantity-represented-b/9Nqu3RUprJFyVpvRoC6d</loc>
            <lastmod>2025-10-07T09:11:32.564Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-adapting-a-large-pre-trained-model-to-a-new-task-employing-a-parameter-efficient-training-metho/9OjufVKE5yOgRcOV9LXa</loc>
            <lastmod>2025-10-10T10:11:56.259Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/approximation-of-the-policy-divergence-penalty/9OxFmtNs6NMiWUJWwvCj</loc>
            <lastmod>2026-01-15T02:59:43.642Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-learning-a-compressed-representation-of-a-long-text-consider-the-optimization-form/9PzVtHrgGk41gkvREr04</loc>
            <lastmod>2025-10-08T16:52:18.499Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-formal-expression-for-a-simple-prompt-denoted-as-x-which-contains-an-instruction-c-and-a-user-in/9R25kJxKK4cKwgK0Sx9R</loc>
            <lastmod>2025-10-04T02:00:47.427Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/goodharts-law-in-reward-modeling/9WIacWM4xEsYni2HWJEY</loc>
            <lastmod>2026-05-03T00:17:50.457Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineering-team-is-refining-a-large-language-model-to-be-more-helpful-and-harmless-they-use-a-tr/9WeTWyLdgYNduRSm7mKw</loc>
            <lastmod>2025-09-28T21:49:33.773Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-trying-to-make-a-task-description-more-concise-by-deleting-non-essential-words-and-ph/9YrYdJXw8BhHDtfzLCj0</loc>
            <lastmod>2025-10-01T22:15:14.931Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-learns-a-function-rinput-response-that-assigns-a-numerical-score-indicating-the-quality-of-/9YsKn55AhQuj11jKmQ3v</loc>
            <lastmod>2025-10-07T08:25:26.334Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-the-pgr-formulas-denominator/9a1RammCTLPz3cCaROCs</loc>
            <lastmod>2025-10-09T00:13:20.409Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/state-function-from-previous-outputs/9ai4NNZbv1fDXpVxHeeK</loc>
            <lastmod>2026-06-26T17:44:33.627Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/value-network-loss-function-in-ac/9bIpiduUNQEjXIonhe1l</loc>
            <lastmod>2026-05-01T16:45:45.188Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-training-an-agent-and-finds-that-two-different-reward-functions-r-and-r-lead-to-t/9cnxZm5IJR0pYlezmq35</loc>
            <lastmod>2025-09-28T12:12:40.102Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-learning-agent-interacts-with-its-environment-in-a-continuous-cycle-arrange-the-following-events-i/9dQL6s7s0UmxPaF9GtEV</loc>
            <lastmod>2025-10-06T11:38:56.474Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/justification-for-using-rlhf-over-supervised-learning/9dYMYyiqUsQXqTkAahME</loc>
            <lastmod>2026-04-20T14:12:20.703Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prevalence-of-advanced-rl-algorithms-in-rlhf/9hZklDOOehctYJrhIsSj</loc>
            <lastmod>2026-01-15T02:55:45.392Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-segmentation-strategy-for-code-evaluation/9iJsCYBl83r6RuvwMoG1</loc>
            <lastmod>2025-10-06T02:55:25.481Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-a-synthetically-trained-chatbot/9jx78LhbjwmkHquhxiCD</loc>
            <lastmod>2025-10-04T17:13:56.306Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-preparing-data-to-teach-a-language-model-how-to-summarize-news-articl/9krpQj9PqPx4Cp2ERRU5</loc>
            <lastmod>2025-09-28T13:38:29.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/notational-simplification-in-fine-tuning-formulas/9nRZzkVzwhOhKNGtf3fW</loc>
            <lastmod>2026-04-18T23:55:42.304Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-team-is-using-a-probabilistic-model-to-rank-three-generated-summaries-a-b-c-the-model-assigns-/9wAaBmOT4gcoTrdL92dK</loc>
            <lastmod>2025-09-28T20:10:53.579Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/empirical-reward-model-loss-formula/9wNBTBj60XNHGMKlAmPZ</loc>
            <lastmod>2026-06-29T04:38:16.562Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-evaluating-a-language-model-and-calculates-the-following-log-probabilities-for-an-inp/9zMEFMDYl5yFtU8pwbF0</loc>
            <lastmod>2025-10-04T04:29:07.724Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-designs-a-prompt-for-a-task-and-finds-it-works-exceptionally-well-with-a-large-state-of-/A0iTKfEdWcjMDOrZUQqb</loc>
            <lastmod>2025-09-28T18:44:09.274Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/challenge-of-opaque-pre-training-data-in-fine-tuning/A3UrrfZVnMfzvN7aOSTu</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/approximated-policy-divergence-penalty-formula/A4LUQJZudHWT9v97f0iy</loc>
            <lastmod>2025-10-08T15:26:50.416Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-modified-policy-optimization-objective/A4kJwaPLJgZSS4afN0T3</loc>
            <lastmod>2025-10-08T20:52:55.271Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/parameter-update-at-the-reference-policy-point-in-ppo/A4kwgJvz6Oj2vjMdAYpi</loc>
            <lastmod>2026-01-15T03:00:56.629Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-tests-two-versions-of-a-language-model-they-provide-both-models-with-the-exact-sa/A6wXybZpcOyTgUQEd5E6</loc>
            <lastmod>2026-04-30T23:33:48.347Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-alignment-strategies-for-specialized-models/A8Uvq4CJ0RSVRLNMBf3P</loc>
            <lastmod>2025-10-01T19:22:06.629Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/chatbot-development-strategy/A8bdCd8ttitDKUdmSZ2F</loc>
            <lastmod>2025-10-05T17:40:09.577Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-trains-a-large-powerful-model-by-fine-tuning-it-on-a-dataset-labeled-by-a-smaller-le/A8nCFIuDvPJSFnbRs6U1</loc>
            <lastmod>2025-09-26T07:54:24.836Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/bradley-terry-model-for-pairwise-preference-probability/AAOrPbKC32cqCKEw1VNl</loc>
            <lastmod>2026-05-02T23:28:57.343Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-human-feedback-in-llm-alignment/AEpreO3Qzghc8dHFEg4R</loc>
            <lastmod>2026-05-03T01:04:09.222Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-trying-to-train-a-language-model-to-generate-engaging-and-creative-stories-they-h/AG7bpjUzdn1yYn92CcPt</loc>
            <lastmod>2025-10-06T11:28:11.218Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-data-generation-strategies/AH5GIgPMd9rPvGuDko6D</loc>
            <lastmod>2025-10-02T07:22:05.942Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/potential-misinterpretation-of-fine-tuning-notation/AHFH6o1L69xOwt3tRI2Y</loc>
            <lastmod>2025-10-06T03:04:56.952Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agents-goal-is-to-navigate-a-simple-environment-and-maximize-its-total-reward-the-agent-is-curren/AHh7WDRz4RdsyiId3GUA</loc>
            <lastmod>2026-06-28T20:44:33.624Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-is-building-a-multi-tenant-llm-service-w/AIrxFH6D7SiXYkB18dUS</loc>
            <lastmod>2026-02-06T18:03:03.564Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fine-tuning-objective-function/AKePbeq5XUjksUyYkLug</loc>
            <lastmod>2026-06-28T14:04:15.042Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-alignment-process-for-a-large-language-model-uses-a-system-composed-of-four-distinct-models-all-s/AKnNirYYQDcgRopYQqBC</loc>
            <lastmod>2025-10-02T06:21:05.093Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-creating-a-new-large-language-model-using-a-two-stage-alignment-process-first-/AMiHRYU9SJzNTwoVMcIS</loc>
            <lastmod>2025-10-06T04:19:29.686Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autonomous-agent-is-programmed-to-navigate-a-grid-when-it-reaches-a-specific-grid-cell-state-s-it/ANrZoegesel9EdjOeGCk</loc>
            <lastmod>2026-06-28T20:44:33.624Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/chatbot-performance-analysis/AOjAAblSmaoodJ6stC0X</loc>
            <lastmod>2025-09-26T11:29:35.210Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-fundamental-model-alignment-approach-with-its-primary-goal-and-typical-implementation-met/AQqKNFwkXhhGv5mptHaX</loc>
            <lastmod>2026-02-08T13:18:53.073Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ppo-clipped-surrogate-objective-in-rlhf/AS8T0KDlbyYJeDG5ovfw</loc>
            <lastmod>2026-06-26T07:16:19.395Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sources-of-llm-misalignment/AWztoeHHc37sLE61UIPF</loc>
            <lastmod>2026-01-15T02:55:45.483Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-a-pre-training-objective-mix-for-a-corporate-llm/AXgmXtlzVrnhkNqulSFa</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-chatbot-training-strategy/AZarzTLhRkvTmSTM1Ufj</loc>
            <lastmod>2025-10-06T18:05:30.926Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-reward-model-flaws-on-value-function-estimation/AahFjWwC4sNHBtXs61r8</loc>
            <lastmod>2025-09-28T19:21:57.587Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-generated-fine-tuning-sample-for-machine-translation/AbfxYMy8fNuKLwjUXVfQ</loc>
            <lastmod>2025-10-09T01:28:14.835Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/efficient-dataset-generation-for-a-custom-nlp-task/Ad8zHs7QbcISDcUVJjgr</loc>
            <lastmod>2025-10-06T23:29:45.206Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-training-a-multi-round-dialogue-model-an-engineer-chooses-to-concatenate-an-entire-k-turn-conve/AdkUlRmFZy9w0jXCvkeb</loc>
            <lastmod>2025-10-05T22:51:15.519Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-building-an-ai-assistant-designed-to-answer-a-wide-range-of-technical-programm/Aer9l2f7A1Yxj40xEtK9</loc>
            <lastmod>2025-10-04T08:31:41.333Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/creating-prompt-templates-for-existing-nlp-tasks/Afrdt0fbHPSAZxe5zFGF</loc>
            <lastmod>2026-05-01T01:05:36.356Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/scaling-instruction-fine-tuning-for-broader-capabilities/AhqmJfdv711moeI0Bax4</loc>
            <lastmod>2026-05-01T11:10:42.868Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-generalization-performance-in-a-real-world-scenario/AiiHYhYnSGMFz71hEkPk</loc>
            <lastmod>2026-05-01T10:46:39.251Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-of-reward-models/AilRHy5wycsh0QmvlZNy</loc>
            <lastmod>2026-06-27T22:11:30.674Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-language-model-api-costs/Aj8xdZVdFB4Q8pUe8Ddu</loc>
            <lastmod>2025-10-01T20:33:49.876Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-building-a-system-to-answer-a-very-high-volume-of-customer-support-queries/Ak02zyrTcBp3HWJiA3Kn</loc>
            <lastmod>2025-10-02T11:24:32.004Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/difficulty-of-encoding-human-values-in-datasets/Al0KoTxOU7VoqG6DU7IR</loc>
            <lastmod>2026-05-01T15:33:37.537Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-specific-notational-system-the-symbol-x-is-used-as-a-shorthand-to-represent-a-multiset-containi/AmDUcD4qEB62rvbzcSaI</loc>
            <lastmod>2026-04-29T04:19:20.084Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/economic-trade-offs-in-sft-data-development/Andcvu2hxOW28BcqT6LS</loc>
            <lastmod>2026-05-01T00:46:13.300Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-system-to-answer-questions-based-on-a-large-document-instead-of-feed/AqNmLcPpB384MYqrDpaX</loc>
            <lastmod>2025-09-28T17:24:50.444Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-as-an-environment-proxy-in-rlhf/AqXXuENV38nhS6DXqPwl</loc>
            <lastmod>2026-04-20T00:41:01.933Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-objective-with-importance-sampling/AsLCb1bw69QA5En4lowS</loc>
            <lastmod>2026-06-17T21:33:04.789Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-the-advantage-function/At1V8B3Fp6jVWvfP4DZo</loc>
            <lastmod>2025-10-08T15:51:12.352Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/threshold-tuning-in-cascading-systems/AugGp36AjQ6MM4jb9H5y</loc>
            <lastmod>2025-10-10T06:07:22.842Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-human-evaluator-is-comparing-four-responses-labeled-y-y-y-and-y-generated-by-a-language-model-they/AyBDf2sqieFHCrUaUlj1</loc>
            <lastmod>2025-10-09T03:38:47.433Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-safety-filter-for-a-language-model-their-goal-is-to-prevent-the-model-from-ge/B0S0DZfpJnmERtpy8tI4</loc>
            <lastmod>2025-09-26T13:04:30.741Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dual-role-of-the-rlhf-reward-model-ranking-based-training-for-scoring-application/B0h3uctXltJSSz8ZBN7d</loc>
            <lastmod>2026-05-01T18:04:33.951Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agents-learning-process-involves-updating-its-decision-making-parameters-based-on-experience-the-/B1L67UGvGrwfQcYLTa7C</loc>
            <lastmod>2025-10-06T13:05:48.172Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/expanding-llm-capabilities-with-synthetic-data/B1uPdAWHC1faGeU6mIfa</loc>
            <lastmod>2025-10-10T01:13:59.604Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-claims-a-language-models-ability-to-follow-instructions-is-exclusively-a/B2LhXk5EhImaz1lPgDV3</loc>
            <lastmod>2025-10-05T16:49:06.994Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/architectural-consistency-in-feedback-based-llm-alignment/B2ZFE2uspIz1egqnHRgb</loc>
            <lastmod>2025-10-06T01:16:39.485Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-preparing-a-large-diverse-text-dataset-to-train-a-powerful-new-language-model-to-improve-t/B2tfydJi7XAMYKwJX4aa</loc>
            <lastmod>2025-10-05T18:23:04.804Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/input-and-output-sequences-in-sft/B5f5MNfSRWJx4V7OgIgJ</loc>
            <lastmod>2026-06-16T22:41:38.376Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/elimination-of-the-reward-model-in-dpo/B6vardwmdgq3qLxjlPZ6</loc>
            <lastmod>2026-01-15T03:05:24.639Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/engineering-and-experimental-effort-in-sft-optimization/B73uaao0ZguyF5fGgr5S</loc>
            <lastmod>2026-05-01T00:49:32.694Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-generalization-failure-in-a-legal-ai/B7n51Va2kKf37sapgj7e</loc>
            <lastmod>2026-02-08T14:18:17.147Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rlhf-policy-optimization-as-loss-minimization/B89oBOed5YnYtpfPE0HV</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-segmentation-implementation-strategy/BBvO2StUeOUXFyoKpMvE</loc>
            <lastmod>2025-09-26T02:08:35.969Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/recommending-an-adaptation-strategy-for-a-legal-tech-startup/BCVc2M8LEmiMhiGOSLfR</loc>
            <lastmod>2025-10-06T21:52:39.967Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-preparing-data-to-train-a-language-model-for-a-french-to-spanish-translation-task-the/BF5lO7mZJTfwdQIGv7ri</loc>
            <lastmod>2025-09-28T15:33:55.353Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-an-aggregation-strategy/BG72YLZ3CwbCHlrO60bZ</loc>
            <lastmod>2025-09-26T09:54:46.845Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-small-startup-with-a-limited-budget-and-access-to-a-single-gpu-wants-to-adapt-a-very-large-pre/BHpGdoiOBXgvR3MRqHxB</loc>
            <lastmod>2025-09-26T02:35:31.374Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-financial-analyst-needs-to-extract-the-exact-figures-for-revenue-net-income-and-earnings-per-share/BJ9OyXJTLzSU9Vm56P1D</loc>
            <lastmod>2025-10-05T12:39:40.776Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-an-experiment-a-researcher-observes-that-the-performance-of-a-strong-model-after-being-supervised/BOj6ASdgoY1t2gfyhPnV</loc>
            <lastmod>2025-10-04T05:13:58.956Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-an-sft-training-sample/BPJUEtMZoyzKYy71Vu8A</loc>
            <lastmod>2025-10-02T08:31:01.429Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-is-fine-tuning-a-pre-trained-language-model-on-a-new-dataset-they-represent-the-optimiz/BPOXBEfdjaQFpTxjRf0H</loc>
            <lastmod>2025-09-26T06:52:50.028Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-segment-score-from-a-language-model/BPj9ai4srfpvpmTwy341</loc>
            <lastmod>2025-09-29T01:25:51.535Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-has-a-large-language-model-that-was-initially-trained-on-a-vast-and-diverse-colle/BRUX9XFbexZttI915TfE</loc>
            <lastmod>2025-10-05T23:46:46.542Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-flawed-policy-gradient-derivation/BRgKjT6LvBhRridweYCW</loc>
            <lastmod>2025-10-08T21:44:41.203Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-an-ai-quality-scorer/BS7jHyMyD117phng6ZTK</loc>
            <lastmod>2025-10-02T18:22:29.178Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/composition-of-reward-model-parameters/BSp8dMisxHQzgcJW6Qu1</loc>
            <lastmod>2025-10-07T12:08:27.597Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-fine-tuned-on-a-dataset-d-containing-two-input-output-pairs-x-y-and-x/BTI0KpDsVbYDIRQvzE8W</loc>
            <lastmod>2025-09-26T13:15:06.089Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/instruction-following-ability-in-llms/BVWFwpvyvzPcJzlLsPfQ</loc>
            <lastmod>2026-04-30T23:40:03.503Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/target-policy-as-a-reward-weighted-distribution/BVhynu9VoAcnEnSBioNL</loc>
            <lastmod>2026-05-03T00:45:17.233Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/weak-to-strong-performance-pweakstrong/BWZhWJqgB9dFyVuqK7Fz</loc>
            <lastmod>2026-05-01T14:56:14.460Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-on-a-large-dataset-of-text-sequences-after-a-single-parameter-upda/BY213OvJ86y7VQWmVYrK</loc>
            <lastmod>2026-04-29T04:19:19.372Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-fine-tuning-trade-offs/BYgytc7kGdZnxDgcejCg</loc>
            <lastmod>2025-10-02T06:28:07.204Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-fine-tuning-a-language-model-with-the-objective-to-maximize-the-sum-of-log-probabilities-across/BZosWjJEoUxwvMpgGbEP</loc>
            <lastmod>2025-10-08T16:29:18.234Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-aims-to-fine-tune-a-language-model-to-be-helpful-and-harmlessqualities-that-are-n/Bb6GelEmqoOeYWNATKtF</loc>
            <lastmod>2025-09-26T06:45:07.588Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-filtering-rules-for-a-specialized-ai/BbbFIuNLf7rc8uhcCSXQ</loc>
            <lastmod>2025-10-10T05:25:07.559Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/visual-diagram-of-a-cascading-model/Bdlg4zlae5mtAgr3JVWK</loc>
            <lastmod>2025-10-09T01:39:17.729Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-shaping-strategies-for-text-summarization/BfJyy0aEuhOEjdunwFcU</loc>
            <lastmod>2025-10-03T01:01:03.073Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/examples-of-prompt-templates-for-english-to-chinese-translation/Bg679uyidGtk2PuO1fZm</loc>
            <lastmod>2026-04-19T20:46:46.599Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-the-risk-lead-for-a-company-rolling-out-an/BhDdXHYsKl0WLev2QbU6</loc>
            <lastmod>2026-02-06T18:26:55.558Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-acquisition-methods-for-instruction-fine-tuning/Bja6CmEQPayigrgyYZIJ</loc>
            <lastmod>2026-02-08T14:07:15.682Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/recurrent-memory-update-using-segments/Bn3X6qDPNAIn4LFlq5Lc</loc>
            <lastmod>2025-10-10T03:46:31.986Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-learning-loss-function-in-rlhf/BpMlwMKjc2daXb41bXwJ</loc>
            <lastmod>2025-10-08T15:43:10.793Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-developing-a-system-to-moderate-user-generated-content-in-real-time-they-have-two-predi/BpVXcNRY71JUZqtyLFz8</loc>
            <lastmod>2025-10-06T11:25:43.425Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prompt-for-a-classification-task/BqSvumdP5UIVeQyEgZQF</loc>
            <lastmod>2026-06-23T20:01:22.105Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-flaw-in-an-automated-data-generation-process/BsB9sB3gcsEIt54qkoVF</loc>
            <lastmod>2025-10-10T06:44:47.797Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-aims-to-build-a-helpful-and-harmless-chatbot-their-strategy-involves-creating/Bt5G5sCAv0ZeZYtV2GL7</loc>
            <lastmod>2025-10-01T21:59:02.179Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/objective-for-a-specialized-math-tutor/Bu22rytyGuqM6PZtv2Jc</loc>
            <lastmod>2025-10-06T13:41:31.609Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/if-an-action-has-a-positive-advantage-value-it-means-that-taking-this-action-is-guaranteed-to-result/BuVVSLau5PXcKsKZv4fl</loc>
            <lastmod>2025-10-07T09:07:00.214Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-product-review-snippet-with-the-most-accurate-aspect-sentiment-pair-that-a-detailed-text-/BwXia9xubZv8IRBzCsmM</loc>
            <lastmod>2025-10-08T13:36:54.607Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-prompt-performance-for-a-less-capable-model/BzLLQ7D2qsOdintmzO5Q</loc>
            <lastmod>2025-10-05T23:37:01.799Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-a-game-playing-ai/C0UKHVg6oJGjyHImGa8H</loc>
            <lastmod>2025-10-10T04:17:41.720Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/persistence-of-general-instruction-following-behavior-after-fine-tuning/C17pzyzEUfIwncgZXsMW</loc>
            <lastmod>2026-05-01T14:39:46.900Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-loss-contribution-analysis/C19hlEp4UTplSUYwqZZc</loc>
            <lastmod>2025-10-04T03:04:42.092Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-student-model-training/C22zmCCtEVs3Mo9Ui8oU</loc>
            <lastmod>2025-09-26T10:37:44.577Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-proposes-a-new-strategy-to-create-a-perfectly-helpful-and-harmless-language-model-the/C2c553NqcGr75iNbPggR</loc>
            <lastmod>2025-10-03T04:06:51.470Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/mechanism-of-reward-model-elimination/C5jZzAzmrkLGjsjPpEub</loc>
            <lastmod>2025-10-02T08:32:21.205Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-fine-tuning-a-large-language-model-using-a-reinforcement-learning-process-that-involves-both/C67DsENsAGrLKjbd9ZFH</loc>
            <lastmod>2025-10-02T06:45:48.665Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-policy-updates-with-the-score-function/C6cyoxgFPKcugowbLg0t</loc>
            <lastmod>2025-10-07T11:51:51.177Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-a-chatbot-for-competing-goals/CA1D0BwsKYmco8BV0vmE</loc>
            <lastmod>2025-10-03T03:16:11.611Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-patient-requesting-an-after-hours-appointment/CABLCJH9gwtfrbNckT9W</loc>
            <lastmod>2025-10-05T13:39:08.849Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-function-estimation-in-rlhf/CDXmxRXBog0EJl1HY1Pu</loc>
            <lastmod>2026-06-21T17:58:28.024Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/appropriateness-of-autoregressive-notation/CEJ3cyGOmw5PJusQWh6s</loc>
            <lastmod>2026-06-26T20:30:27.190Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-training-a-chatbot-to-handle-customer-service-inquiries-the-systems-goal-is-to-resolve-/CEuE9aYjR175CzrhsWp8</loc>
            <lastmod>2025-10-06T13:32:30.077Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-listwise-loss-formula-used-for-training-on-ranked-preferences-mathcall-mathbbeleftfracn/CJ2HibWuiZd7Zm6B3oRH</loc>
            <lastmod>2025-10-08T21:21:58.997Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/function-of-a-sequence-of-average-vectors-notation-sbarmathbfy-dots-barmathbfyk/CKHQg4DLuvNlhZo2E0AU</loc>
            <lastmod>2026-06-29T00:10:09.941Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-conversational-memory-failure/CNrfxXoGtr6xOeLgFCxB</loc>
            <lastmod>2025-10-08T20:29:55.408Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-formal-expression-for-a-simple-prompt-represented-as-x-c-z-match-each-variable-to-its-correct/CPbYphdSBqPOgQa0EeG4</loc>
            <lastmod>2025-10-08T20:50:02.766Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-applying-reinforcement-learning-to-a-language-model-the-models-strategy-is-defined/CSrnpxeTidsboYDIdkzS</loc>
            <lastmod>2025-10-08T23:07:08.976Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/initialization-of-the-task-pool-in-self-instruct/CTLm5QMBi1USDczFcvxo</loc>
            <lastmod>2025-10-10T03:53:27.240Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-derivation-of-a-policy-based-reinforcement-learning-algorithm-the-gradient-of-the-log-probabi/CTcmbKPlhHkgcE4s5zYc</loc>
            <lastmod>2025-09-26T02:48:15.879Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-a-reinforcement-learning-update-step-for-a-language-model-a-generated-response-action-is-eval/CUBRfxpHRbAWWaCVsxUN</loc>
            <lastmod>2025-10-07T08:10:58.537Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-implementing-a-strategy-where-a-powerful-language-model-learns-from-a-less-capable-one-arr/CXRroc318hy7QhxEIqFw</loc>
            <lastmod>2025-10-10T03:26:04.763Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-language-model-for-a-customer-service-chatbot-they-are-deciding-between-tw/CYarzt29gNQZHLA2nbqM</loc>
            <lastmod>2026-05-01T16:24:16.966Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/from-model-scores-to-probabilities/CZXWtu67WeJHWX0djTi8</loc>
            <lastmod>2025-10-05T21:55:14.267Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-chatbot-generalization/CZfAUChkWERMsZvTPKw4</loc>
            <lastmod>2025-10-05T17:51:50.586Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-preference-model-calculates-the-probability-that-output-ya-is-preferred-over-output-yb-by-applying/CaiWFdVLjFc3V5pdD5mO</loc>
            <lastmod>2025-10-08T15:27:33.288Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-integrating-multiple-diverse-reward-models-for-training-a-language-model-what-is-the-primary-co/CbjjzKYlFapWJ48DVsYM</loc>
            <lastmod>2025-10-03T01:21:06.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/segment-based-reward-computation/Cbq4SamVJOfPgKGhER6P</loc>
            <lastmod>2026-05-03T00:07:54.247Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-predictive-inference/CdyWUVdtwQqRnabWldlO</loc>
            <lastmod>2026-06-21T21:52:27.886Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-fine-tunes-a-large-language-model-on-an-extensive-dataset-containing-hundreds-of-tho/Cg8iw7ipnOQcKmCZJhFZ</loc>
            <lastmod>2025-10-05T15:16:49.260Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-pre-training-only-approach/ChSQk6KNBFSY1RuDukej</loc>
            <lastmod>2025-10-06T23:26:49.401Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-data-generation-pipeline-issue/CkGOVXNxNWqFqn3Vboqj</loc>
            <lastmod>2025-10-10T06:01:40.575Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-niche-fine-tuning-strategy/ClhNgUQQlZ9wtycbJ9ig</loc>
            <lastmod>2025-10-06T17:27:40.563Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-preference-model-calculates-the-probability-that-response-ya-is-preferred-over-response-yb-for-a-g/CnbNmjSOcCteqdQTcgot</loc>
            <lastmod>2025-09-26T02:16:17.250Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-fine-tuning-of-a-large-language-model-at-a-specific-generation-step-t-the-calculated-adva/Coqnt3OaGTx5Mdhjf8Rg</loc>
            <lastmod>2025-10-08T23:20:54.676Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-peft-implementation-bug-prompt-tuning-vs-prefix-fine-tuning/Cr8FuNN6XoxqnlCbX9c1</loc>
            <lastmod>2026-02-06T18:01:19.087Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-cross-entropy-for-data-curation/CtHH9uCvwPx3GcHZtUcW</loc>
            <lastmod>2025-10-06T19:42:06.594Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autonomous-agent-is-being-trained-to-navigate-a-maze-at-a-specific-intersection-a-state-it-can-ei/CueMgCeEJOanVPHck5qn</loc>
            <lastmod>2025-10-02T03:14:07.784Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-flawed-model-training-strategy/CuoZ2mmkE4Rcki1DHGYR</loc>
            <lastmod>2026-04-29T03:51:54.664Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-language-model-has-been-specifically-trained-to-function-as-an-expert-assistant-for-medical-/CyDJXsm9Q8fLnUQBdIkr</loc>
            <lastmod>2025-09-29T01:32:35.018Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-model-mimicry-performance/Czq8m2PGOLAzwkUkGFZJ</loc>
            <lastmod>2025-10-07T00:10:43.571Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-prompt-simplification/D08ZTOtauxVHq2zOsJGL</loc>
            <lastmod>2025-10-06T02:01:27.915Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-language-model-to-generate-compelling-short-story-endings-to-gather-human-fee/D2bEPAKN2wwn6PaLlgIS</loc>
            <lastmod>2025-10-02T04:09:37.576Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-a-zero-advantage-value/D5seY39jvU87n6Wvfvo0</loc>
            <lastmod>2025-10-04T03:42:34.435Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-has-successfully-developed-a-powerful-general-purpose-language-model-their-next-goal-/D6W6QQZXLHpZKMSThZ7Q</loc>
            <lastmod>2026-02-08T14:07:27.636Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-text-generation-model-is-tasked-with-completing-the-sentence-the-mountain-climber-reached-the-summ/D72P4v1GtQJ3oNE1rCUb</loc>
            <lastmod>2025-10-05T17:09:08.609Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-objective-as-joint-log-likelihood-maximization-of-concatenated-sequences/D8Ik71lZSAiG7kSdbRjA</loc>
            <lastmod>2026-06-24T23:27:38.407Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-training-as-a-ranking-problem-in-rlhf/D9BkvZKn8ak4RJJF1sXT</loc>
            <lastmod>2026-05-02T23:24:14.416Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-an-optimization-strategy-for-fine-tuning/DA3VvmlrXo97KJv4ZIOv</loc>
            <lastmod>2025-09-28T16:13:43.079Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/complexity-of-human-values-in-llm-alignment/DC2ITeYPiQtJquSwVz47</loc>
            <lastmod>2026-02-08T13:12:01.896Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selective-loss-computation-in-joint-probability-language-modeling/DFEwhKDbWZTEUPQNARW4</loc>
            <lastmod>2026-05-01T00:08:20.679Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-behavioral-changes-in-a-trained-llm/DHZzuz8sxdBK8nqij3hF</loc>
            <lastmod>2025-10-08T12:56:20.864Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-cleaning-robot-is-programmed-to-maximize-a-reward-signal-which-is-based-on-the-amount-of-dust-it-c/DHc4EWj8yGkE4EtDxQT1</loc>
            <lastmod>2025-09-28T12:49:41.888Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deciding-whether-and-how-to-use-weak-model-synthetic-data-for-instruction-fine-tuning/DIj7Uq1VwRZwIVYbCcEW</loc>
            <lastmod>2026-02-08T13:57:01.828Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/proximal-policy-optimization-ppo/DIqdS4wx5H5KsTNP1duM</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-log-probability-based-reward-for-reasoning-paths/DKE3DMSys4SSuDU2tRJR</loc>
            <lastmod>2026-05-03T15:03:39.114Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/benefits-of-using-qa-website-data-for-fine-tuning/DLr4GWmzomWGkAjKKfZi</loc>
            <lastmod>2026-01-15T03:06:32.856Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-creating-a-fine-tuning-dataset-for-a-language-model-to-perform-english-to-spanis/DObQgZ9XukEeri8NeELQ</loc>
            <lastmod>2025-10-09T03:46:32.692Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/semantic-completeness-in-rlhf-reward-models/DQxOJRhHU103EeAIrI8j</loc>
            <lastmod>2026-05-01T16:52:57.590Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/utility-of-action-specific-value-estimation/DRmnFdEFLvfr3fD1eONv</loc>
            <lastmod>2025-10-06T11:29:42.688Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-model-is-being-trained-using-a-combined-objective-that-incorporates-signals-from-both-ground/DS7iOERvJz7kwuvtX700</loc>
            <lastmod>2025-10-06T11:36:38.766Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/listwise-loss-from-accumulated-pairwise-comparisons/DVIoVcRloFmjKz3ImTwf</loc>
            <lastmod>2026-05-02T23:24:59.236Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autonomous-agent-is-navigating-a-maze-at-a-particular-state-the-agents-value-function-estimates-t/DWDGUnHjHnD81YdE8f3s</loc>
            <lastmod>2025-10-06T18:28:07.990Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-fine-tuning-a-large-language-model-using-a-reinforcement-learning-app/DWfrGDuxcMPdr5gSDIvL</loc>
            <lastmod>2025-10-06T19:42:52.125Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-a-reward-model-with-preference-data/DWw2bgqCtYf03gp7v9vs</loc>
            <lastmod>2026-06-24T04:05:19.358Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-ai-preference-labeling-for-customer-service-responses/DXvXwnEwzVp9J63KdLKy</loc>
            <lastmod>2026-05-03T01:05:02.371Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-model-to-predict-a-quality-score-for-individual-segments-of-a-generated-text-th/DY58O9bN6CFxqGKieBND</loc>
            <lastmod>2025-10-02T04:32:26.859Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-aggregated-reward-signals-in-model-training/DYh48UZppXQoohEoQBBs</loc>
            <lastmod>2025-10-05T19:25:57.562Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-instruction-fine-tuning-dataset-strategies/DZCqnJQ67esVAR9EQQwU</loc>
            <lastmod>2026-02-08T14:40:17.364Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-adapting-a-pre-trained-language-model-by-fine-tuning-it-on-a-dataset-of-instructions-and-t/DZueWjsXdDrXScHpFuQR</loc>
            <lastmod>2025-10-07T10:30:48.373Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agents-performance-is-evaluated-using-a-function-jtheta-which-depends-on-a-set-of-parameters-thet/DeKr0vdWi7L8uCCz79tr</loc>
            <lastmod>2025-09-26T04:39:08.011Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-testing-two-methods-to-guide-a-language-model-for-a-text-summarization-tas/DhI0aauShDB6xBghqACT</loc>
            <lastmod>2025-10-06T22:57:44.937Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rlhf-component-interaction-during-token-generation/DhL5U96iMx3iwS9wZcgi</loc>
            <lastmod>2025-10-10T03:59:25.793Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-repetitive-model-output/Dl4w0flBGPAC2wqe4OQb</loc>
            <lastmod>2025-10-05T17:57:08.180Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-a-preference-model-for-ai-fine-tuning/DnCCYrgUJZT5I8OGW2dc</loc>
            <lastmod>2025-10-10T04:35:03.112Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-reviewing-two-candidate-memory-designs-for/DoIdkZY5TNZzb3H1AMPR</loc>
            <lastmod>2026-02-06T18:31:44.308Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-dataset-for-a-real-world-ai-assistant/Dp8puQZNrJVTBuSo6jr3</loc>
            <lastmod>2025-10-06T12:08:54.222Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-attempting-to-use-a-standard-transformer-based-llm-for-real-time-analysis-of-c/Ds5odYqtr8O4YF2av1YJ</loc>
            <lastmod>2025-10-03T02:12:51.856Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-singular-alignment-approach/DuLccVo7QVG0Y7ocbeYm</loc>
            <lastmod>2025-10-06T14:01:39.245Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/instruction-sampling-for-diversity-in-self-instruct/DuWp2e2Bjrjk6vPD9sfv</loc>
            <lastmod>2025-10-10T04:00:03.799Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-has-fine-tuned-a-large-language-model-to-be-a-helpful-assistant-they-observe-that/DwasnvrzNchm5yu2cQzg</loc>
            <lastmod>2026-02-08T14:11:49.593Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-system-to-automatically-generate-new-instructional-tasks-for-a-large-language/DyIQ2aKQVAbkmryaTbUR</loc>
            <lastmod>2025-10-02T04:38:03.572Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-an-alignment-strategy-for-a-resource-constrained-project/DzbnOaLM1WLZo125B5FZ</loc>
            <lastmod>2025-10-02T05:18:16.787Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/equivalence-of-training-objectives/E1DXUx4TAhu9fY2BTDen</loc>
            <lastmod>2025-10-03T21:28:29.823Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-typical-system-for-aligning-a-language-model-with-human-feedback-it-is-common-practice-to-use-a/E1yeWv6rps9anearZL1A</loc>
            <lastmod>2025-10-10T10:09:51.513Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/refining-a-complex-instruction/E4ONBZwMdobWisaMykmo</loc>
            <lastmod>2025-09-26T15:43:30.835Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-training-a-model-to-classify-segments-of-text-into-predefined-categories-eg-appropriate-or-i/E4bv2W5EDWARIgHrloiR</loc>
            <lastmod>2025-10-10T04:04:55.372Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/computational-and-stability-challenges-of-rlhf/E4z32SXZJEDpbu4cmCgk</loc>
            <lastmod>2026-05-03T15:23:03.706Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/three-stage-training-process-of-rlhf/E54YTPpF5MLwqk9NO8R2</loc>
            <lastmod>2026-05-02T23:23:04.101Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/if-an-increase-in-one-variable-is-always-accompanied-by-an-increase-in-a-second-variable-the-relatio/E5OO1RHYsTeb1MbmTD3w</loc>
            <lastmod>2025-10-08T12:32:59.740Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/modern-focus-of-instruction-fine-tuning-datasets/E64IM7KpwmobFBEFOEBJ</loc>
            <lastmod>2026-05-01T11:10:24.814Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/bridging-language-modeling-and-reinforcement-learning-notations-in-rlhf/E6yQaZM7wIqiqtdhHkvB</loc>
            <lastmod>2026-01-15T02:59:46.232Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/soft-prompting/E7P35O6LjylQ75h1NwFu</loc>
            <lastmod>2025-10-07T15:05:42.622Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-a-text-generation-process/E9R9cpDS9h5uAFPQQIDz</loc>
            <lastmod>2025-10-09T00:55:09.888Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/predicting-llm-behavior-post-specialization/ECBlX28VR5i5AX6DWcih</loc>
            <lastmod>2025-10-09T02:45:02.715Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-software-development-team-is-building-several-features-powered-by-a-large-language-model-they-want/EDAhB37UGEWeWHkwehcm</loc>
            <lastmod>2025-10-03T19:18:05.980Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-training-objectives-for-a-chatbot/EGFGIYMlAJLF1mWZrC1o</loc>
            <lastmod>2025-10-06T11:42:01.996Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-working-on-an-ai-assistant-after-its-initial-training-they-find-that-while-the/EHkvjMaTjU0UyK1XwngJ</loc>
            <lastmod>2025-09-28T17:10:56.687Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-tech-startup-is-fine-tuning-a-language-model-to-serve-as-a-creative-partner-for-writing-scripts-in/EK0SJSJVpvXsmyD5kGVz</loc>
            <lastmod>2025-10-01T18:53:48.004Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/input-inversion-for-mitigating-data-generation-bias/EKbvhSVdSHz8tNPrqUiJ</loc>
            <lastmod>2026-05-01T10:19:13.511Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-fixed-model-assumption-in-policy-optimization/ELsezFl5gRr7JQhwFDce</loc>
            <lastmod>2025-10-02T23:26:28.856Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-working-with-a-large-pre-existing-language-model-they-need-to-make-the-model-g/EM7rG5sXWlybfj9al9sT</loc>
            <lastmod>2025-10-10T09:18:50.926Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-language-model-response-probabilities/EMk5V8YAgK9wAuNVECWw</loc>
            <lastmod>2025-10-03T21:51:15.640Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-curating-a-high-quality-dataset-for-fine-tuning-a-large-computationally-expensiv/EMvPzgEBdGieZeCcV51d</loc>
            <lastmod>2025-10-05T21:34:25.683Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/challenge-of-context-compression-for-long-sequences/EN9NcALycxDjC1pNdNqB</loc>
            <lastmod>2025-10-05T00:28:55.390Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-language-model-development-technique-with-the-description-that-best-classifies-its-stage-/EOfJC6TExSo7WUDYo8NJ</loc>
            <lastmod>2025-10-06T00:33:12.226Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-language-model-task-description/EQ0eu0JjgGVZ4QntpAqU</loc>
            <lastmod>2025-10-04T09:08:14.469Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/combined-use-of-instruction-and-human-preference-alignment/EQb4h2ol1sPh5BBYEJN6</loc>
            <lastmod>2026-05-01T11:03:15.084Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-fine-tuning-dataset-for-a-medical-chatbot/ES3pmjKD3mSGBlS5V0Su</loc>
            <lastmod>2025-10-05T18:12:05.971Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/pointwise-rating-loss-lrating-formula/EYwLsxanKSfQo7ouAtVS</loc>
            <lastmod>2025-10-08T15:57:33.217Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-preparing-a-dataset-to-fine-tune-a-language-model-for-translating-french-legal-text-t/EZAQOTFmCVpdThz3ONQw</loc>
            <lastmod>2026-05-01T00:56:27.293Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-the-sft-objective-function/EZzowvpvVvwg4sFNUo0r</loc>
            <lastmod>2025-10-03T21:56:58.433Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/triage-plan-for-a-safetybiasprivacy-incident-in-a-customer-facing-llm/EawjytGEFVX1bLoTBdq4</loc>
            <lastmod>2026-02-06T18:25:01.662Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-derivation-of-a-policy-gradient-algorithm-we-aim-to-update-a-policy-based-on-actions-taken-wi/Ef5v1LFl77M44H54zw4K</loc>
            <lastmod>2025-10-07T09:02:27.351Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-creating-a-set-of-prompts-to-make-a-large-language-model-perform-text-summarizat/EfMQ1BvrTuR8UVXRKQK2</loc>
            <lastmod>2025-10-10T03:42:47.686Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-evaluating-three-ai-generated-responses-labeled-x-y-and-z-they-collect-the-following-pairw/EfndZlFNom20IZFoi0XQ</loc>
            <lastmod>2025-10-08T22:29:57.669Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-failed-prompt-simplification/EfzLwTg8yb2C8sVyC99w</loc>
            <lastmod>2025-10-02T07:12:03.079Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-policy-effectiveness/EgVUGV7kADE21FtWeguj</loc>
            <lastmod>2025-10-03T01:37:50.843Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-the-clipping-range-in-policy-optimization/EhTgWfBh3EBjZEDRsAA6</loc>
            <lastmod>2025-10-08T15:29:14.592Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-system-to-score-individual-sentences-within-a-long-multi-paragraph-response-g/EhhHFTavHeTN7NAshdD1</loc>
            <lastmod>2025-09-28T19:14:25.861Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-trade-off-in-a-policy-optimization-objective/EjLiC0YIfuT7wtZOBIoE</loc>
            <lastmod>2025-10-08T21:30:24.027Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/norbert-wieners-warning-on-ai-alignment/Ejb7B96davbE0qye9xwd</loc>
            <lastmod>2026-05-03T15:44:59.449Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-policy-change/EmFdTKf6v6Xar3X7f0cT</loc>
            <lastmod>2025-10-06T20:27:03.209Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/risk-of-overfitting-in-weak-to-strong-fine-tuning/EmYaxFeLLsWHbbF89ZEH</loc>
            <lastmod>2026-05-01T14:55:11.045Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-technique-for-improving-a-models-performance-involves-iteratively-refining-a-set-of-special-input-/Eo6rGcYHX5WbFcwbpK03</loc>
            <lastmod>2025-09-29T02:08:15.334Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-impact-of-a-policy-divergence-penalty/EoQvs1yfGpbPIiargvMs</loc>
            <lastmod>2025-10-07T10:09:45.980Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-trying-to-make-a-language-model-consistently-adhere-to-a-long-complex-style-guide-ins/EoabKT8yuNyKIudYeB65</loc>
            <lastmod>2025-09-26T10:13:58.899Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-lead-an-llm-enablement-team-building-an-instru/Er6TOpazDBswzRsns1D1</loc>
            <lastmod>2026-02-08T13:57:11.715Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-developing-a-model-to-generate-one-sentence-summaries-of-news-articles-they-have-access/EsLoYOzfusa6gazTpiMl</loc>
            <lastmod>2025-10-01T21:44:00.776Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/preference-for-divergence-based-objective-functions/EscM7H5tM78fFdsoVsT4</loc>
            <lastmod>2026-01-15T03:06:28.385Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-reward-models-with-classification-loss-for-segment-alignment/EtXzmWPIGvHsCRd02HAw</loc>
            <lastmod>2025-10-10T04:05:02.626Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-context-aware-reward-model/EtnDGH1dvNdvLf7D6LWW</loc>
            <lastmod>2025-10-02T21:40:26.623Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-notational-simplification-in-preference-models/EueSNKf3Q1TPOFQLwcSI</loc>
            <lastmod>2025-10-06T20:38:23.578Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-an-alignment-method-for-a-resource-constrained-project/EuxPwzzScvzaUACGE7gr</loc>
            <lastmod>2025-10-02T04:58:24.215Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-is-developing-a-new-language-model-their-primary-goal-is-to-create-a-model-that-can-r/EvWPDg8NSRdteAx3simz</loc>
            <lastmod>2025-10-03T00:11:26.238Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-function-formula/Ew5q7a3vQlyxhTbrBdTz</loc>
            <lastmod>2026-05-01T16:46:33.322Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-objective-function-designs/EwFsb0PMwJQskIZriS5j</loc>
            <lastmod>2025-10-06T11:48:56.685Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/converting-model-scores-to-probabilities/Ey4NXSGhxaxEhgOb28UO</loc>
            <lastmod>2025-10-10T06:29:59.021Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ensembling-small-models-in-llms/F0XSdOasdjK9Yah7t4QI</loc>
            <lastmod>2026-05-01T15:43:10.912Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/segment-score-as-difference-of-sequence-scores/F0kOZO1j4faAiFkuhodL</loc>
            <lastmod>2026-05-03T00:07:04.866Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/connecting-past-and-present-nlp-interaction-methods/F0lphtYHNlRbxrNBYaT4</loc>
            <lastmod>2025-10-02T10:01:07.677Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-policy-divergence-penalty/F1vsqZgx5NPRbhJu61J7</loc>
            <lastmod>2025-10-02T08:06:00.925Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-trains-two-different-preference-models-model-a-and-model-b-on-the-exact-same-dataset-/F2uubFeOxhaiZJHGShLX</loc>
            <lastmod>2025-10-02T23:30:41.887Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-llm-performance/F30mWZZkNAeUad90zwhk</loc>
            <lastmod>2026-02-08T14:18:14.082Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/complexity-of-reward-model-training-in-rlhf/F7qm2YIffLhgs6GTA5hL</loc>
            <lastmod>2026-05-03T00:33:58.531Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/aggregation-methods-in-ensemble-learning/F9McDPuMOHtPHkrFszi3</loc>
            <lastmod>2025-10-10T08:42:52.510Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-an-ai-alignment-strategy/FAJLhsrdvk17BrmOGklN</loc>
            <lastmod>2025-10-03T04:59:26.607Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-instruction-tuned-model-is-evaluated-on-a-specific-task-summarizing-legal-documents-the-goal-is-t/FAkCxSeG9nbwFEj1zDHI</loc>
            <lastmod>2026-06-29T07:28:49.847Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-aims-to-fine-tune-a-language-model-to-function-as-a-highly-reliable-and-accurate-/FGhdE4iq2TQQJ9zFo2Be</loc>
            <lastmod>2025-10-02T11:05:42.791Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-misaligned-llm-response/FHudT7mPU02xwfDfexwu</loc>
            <lastmod>2025-10-09T01:20:57.818Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-generating-a-completion-for-an-input-x-the-model-has-a-base-probability-distribu/FIHjS3zKTvUSft4UvH8q</loc>
            <lastmod>2025-10-07T08:22:15.516Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-trains-a-language-model-to-generate-helpful-summaries-of-news-articles-they-c/FIOryhmwE7Udfx6wLOq2</loc>
            <lastmod>2025-10-07T04:39:57.087Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-quarterly-financial-report-data/FJUy50VncdyWviLtNOcb</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-data-generation-strategies-for-model-generalization/FMmhMCnY6i2cBNvKDC2e</loc>
            <lastmod>2025-10-06T12:53:47.924Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-using-three-specialized-reward-models-to-evaluate-generated-text-one-for-g/FN7aFHY1FncSVJK49hul</loc>
            <lastmod>2025-10-03T02:34:21.888Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/learning-curve-in-technology-production/FNjR61NghaPuL2CGpVyW</loc>
            <lastmod>2025-09-16T15:55:48.627Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-value-function-training/FOKa6eyZdOA8eNcOhC5Z</loc>
            <lastmod>2025-10-04T03:36:51.183Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/mlm-training-objective-using-cross-entropy-loss/FQBqL0MjYUJy0SdeYNWU</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/historical-antecedents-of-prompting/FQDKgqziAZpyQ4shn3PN</loc>
            <lastmod>2026-01-15T03:05:25.497Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-data-scientist-is-using-a-large-language-model-to-generate-synthetic-examples-of-customer-feedback/FRKaejfGMKpu1CNXRRNo</loc>
            <lastmod>2025-09-26T09:27:33.401Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/constructing-a-fine-tuning-sample-for-translation/FRYOREqWVobJawChv01a</loc>
            <lastmod>2026-05-01T00:56:27.293Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/role-of-context-in-segment-based-reward/FTyK2ELr5mG2u69iVMuS</loc>
            <lastmod>2025-10-08T23:28:31.073Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-training-objectives-for-model-adaptation/FUXeDtBMKyWpZS1ovo93</loc>
            <lastmod>2025-10-05T18:38:57.364Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/both-a-standard-generative-language-model-and-an-rlhf-reward-model-are-often-based-on-the-same-core-/FXY46zUW5btDqxmTbRsE</loc>
            <lastmod>2025-10-02T11:57:29.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-an-early-machine-translation-system/FY7YMSMBmVLDGo2F2WQE</loc>
            <lastmod>2025-10-06T21:29:08.861Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-scenario-an-agent-is-in-a-particular-state-the-estimated-value-of-being-/FZnVaZZPsRJNAYFmV977</loc>
            <lastmod>2025-10-07T08:06:57.305Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-a-financial-data-extraction-prompt/FZzsqPfIDoCxDCFUt46z</loc>
            <lastmod>2026-06-27T17:54:58.410Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-fine-tuning-a-pre-trained-language-model-using-a-dataset-of-high-quality-instruction-respo/FaftuGenaCFMndVLu3Cu</loc>
            <lastmod>2025-09-26T04:42:02.845Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/strong-ceiling-performance-pceiling/Fam5t2cZZJMzZbpS0sKU</loc>
            <lastmod>2026-05-01T14:56:27.365Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/patient-preference-for-after-hours-medical-appointments/FcGxBQa8Wuz2oQlu0xLg</loc>
            <lastmod>2025-10-05T13:39:26.590Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-interacts-with-a-language-model-by-providing-an-instruction-and-an-input-the-instruction-is-s/Fd8rke1ceAePm6FTshWw</loc>
            <lastmod>2026-02-08T14:18:30.517Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/general-notation-for-conditional-probability-in-sequence-generation/FdQaPsh15B7t2qzNOBGr</loc>
            <lastmod>2026-06-16T01:38:49.147Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prompt-as-a-form-of-context/FdxTC525unjgR8uqJClb</loc>
            <lastmod>2026-04-30T22:35:19.156Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/practical-implications-of-the-policy-gradient-simplification/Feu1O941OqEWy97rHrBQ</loc>
            <lastmod>2025-10-08T14:57:19.679Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/characteristics-and-limitations-of-early-instruction-fine-tuning-datasets/FkqhQqYeDS2coPVqePWL</loc>
            <lastmod>2026-05-01T11:10:05.733Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/explaining-overoptimization-with-goodharts-law/FmtJ5wh2TVMpq6ypE3ZM</loc>
            <lastmod>2026-05-03T00:18:08.707Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-a-value-models-loss-calculation/FoPaENYLGB2aEG6PCC9f</loc>
            <lastmod>2025-09-26T06:26:44.816Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/structure-of-a-task-sample-in-self-instruct/Fokf4uI4DxcgZfRUJ6z6</loc>
            <lastmod>2025-10-07T15:14:26.068Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/youre-leading-an-llm-platform-team-building-an-in/Foomr5sjvg5aQpIrol6A</loc>
            <lastmod>2026-02-08T13:57:11.171Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-reinforcement-learning-system/Fp4C7c9k4tXpbo80CR0N</loc>
            <lastmod>2025-10-07T11:08:40.292Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-with-a-limited-budget-aims-to-fine-tune-a-large-powerful-language-model-for-a-special/Fpfo8UlYNffZK1lvodLQ</loc>
            <lastmod>2025-10-06T11:39:42.758Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-paradox-of-optimization-in-reward-modeling/FpmWgAdOjCPjxk7tumIw</loc>
            <lastmod>2025-10-06T13:57:34.591Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-system-where-a-set-of-learnable-non-textual-prompt-vectors-are-processed-by-a-models-main/FqSpz2LUJonxQcv16I6o</loc>
            <lastmod>2025-10-02T04:47:34.875Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/identifying-the-agent-in-a-game-playing-ai/FuD23QdS5ERdDLbjtrIS</loc>
            <lastmod>2025-10-02T06:01:02.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-reinforcement-learning-agent-being-trained-with-a-policy-gradient-method-for-a-given-stat/FvesR1qVQ4RRD7YcPQzx</loc>
            <lastmod>2025-09-28T17:23:20.364Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-student-model-is-being-trained-using-a-combined-objective-that-includes-a-term-for-learning-from-a/FwpWus688fj3S2Zilja8</loc>
            <lastmod>2025-10-10T06:13:48.083Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/purpose-of-reward-decomposition-in-policy-gradient/FxgSHcHb7fFWb8YHWYEK</loc>
            <lastmod>2025-10-04T01:50:18.968Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-an-actor-critic-agents-performance/Fz6e2EdKOPcHI3dg5Spj</loc>
            <lastmod>2025-10-05T20:39:05.200Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/implicit-learning-of-instruction-response-mappings-during-pre-training/G21yBzxF55ATQppRSwzs</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-policy-optimization-phase-of-training-a-large-language-model-the-model-is-being-rewarded-/G3en5k64X5nlDoIzwXXF</loc>
            <lastmod>2025-10-02T02:48:14.418Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-the-negative-expected-utility-loss-function/G3uKBYItJH6KLDgg0OGq</loc>
            <lastmod>2025-10-03T21:23:45.798Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-an-ai-game-player/G4XhVuLFBdUFYdIGsbUS</loc>
            <lastmod>2025-09-28T15:16:58.294Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-llm-training-observations/G8FzqFgys2seAqj4kxY3</loc>
            <lastmod>2025-09-26T12:46:00.701Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-fine-tuning-sample-for-machine-translation/G8PLaBb6U7buGht8lhPT</loc>
            <lastmod>2025-10-10T00:49:42.383Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dataset-composition-for-rl-fine-tuning-in-rlhf/GBPTktqpyi3Ij0YJsHxi</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-wants-to-improve-a-powerful-language-models-ability-to-follow-specific-instructio/GBaMSOYedTmj6fJ0ve5q</loc>
            <lastmod>2025-10-10T05:12:50.459Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-score-formula-for-llm-based-reward-models/GCP1evhZwZ9fYtoMFuTe</loc>
            <lastmod>2026-05-01T16:53:24.989Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-evaluated-for-a-given-input-sequence-x-and-a-potential-output-sequence-y-t/GCzC267Dhg2z8fxpZuX2</loc>
            <lastmod>2025-10-08T23:22:14.880Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-improvement-decision/GElfB9QcKPxHFPCKVqn8</loc>
            <lastmod>2025-10-03T21:26:25.782Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-in-a-phase-of-training-where-their-goal-is-to-make-a-language-models-respo/GFOrMzm0IqUYKG18prKE</loc>
            <lastmod>2025-09-26T07:39:03.877Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-evolving-meaning-of-alignment-in-language-models/GFiFYLMwY8vEEGOQltML</loc>
            <lastmod>2025-10-02T19:39:08.123Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-policy-divergence-penalty/GH5acoCVLetGZhiTuUIc</loc>
            <lastmod>2025-10-04T05:24:27.397Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-data-filtering-strategy/GHcKxmf0wmkgYSLuofyY</loc>
            <lastmod>2026-02-08T14:29:16.645Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-text-generation-model-using-a-reinforcement-learning-algorithm-they-notice/GIFt9t9CdMfSbAbY9LL6</loc>
            <lastmod>2025-09-26T08:52:51.072Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-generates-a-three-paragraph-summary-of-a-research-paper-the-first-paragraph-accurat/GKljz1Eof2UdsL1UES29</loc>
            <lastmod>2025-10-07T09:31:49.728Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-objective-as-loss-minimization-over-a-dataset/GLE81Ft5RXr983lWMdJy</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-feedback-for-an-empathetic-ai/GNF3q82Sl7b4dpMJ4T8f</loc>
            <lastmod>2025-10-10T09:52:58.271Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prioritizing-annotation-on-confidently-incorrect-reasoning-steps/GNfNIEcZLxcNKsKcc2MT</loc>
            <lastmod>2026-05-03T15:06:44.382Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/modeling-challenges-in-conversational-systems/GPekpClhbq93c9VcftZC</loc>
            <lastmod>2025-10-05T23:30:00.479Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-has-a-powerful-general-purpose-language-model-that-can-write-essays-answer-questions-and-s/GRGQysG4qljrbTyfJhE2</loc>
            <lastmod>2025-09-28T20:20:00.736Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-language-model-pre-trained-on-a-vast-dataset-from-the-internet-is-tasked-with-being-a-helpfu/GSz8qSThNAFK3VuLtgOy</loc>
            <lastmod>2026-02-08T13:12:07.636Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-has-a-large-pre-trained-language-model-designed-for-general-text-understanding-initi/GTV3ucQ8xVOM2gyFA8Cu</loc>
            <lastmod>2025-09-29T02:01:41.474Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-failed-summarization-attempt/GUk0i4CjUQHhGY3hfT8N</loc>
            <lastmod>2025-10-04T07:44:16.073Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimal-policy-as-a-product-of-reference-policy-and-exponentiated-reward/GV4jFa9fCX9zwBHjbfSx</loc>
            <lastmod>2025-10-08T16:08:09.397Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-evolution-of-model-interaction/GVVJZR56xFKVIjIZx3sd</loc>
            <lastmod>2025-10-06T12:02:47.377Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/combined-training-objective-for-knowledge-distillation/GXkvEaste4vU2DJODYFD</loc>
            <lastmod>2025-10-06T12:25:15.636Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-dataset-expansion-strategies/Gb1HCopaJW85ZeXpl0oC</loc>
            <lastmod>2025-09-28T12:23:14.570Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-using-human-feedback-to-improve-a-language-models-ability-to-follow-instructions-safely-an/Ge4vxm0Se8hzXtpObZW6</loc>
            <lastmod>2025-10-05T19:35:26.592Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/vendor-llm-procurement-decision-balancing-safety-bias-privacy-and-refusal-alignment/GfeNvWumT1M9IFrSxi5i</loc>
            <lastmod>2026-02-06T18:25:11.171Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-considering-using-supervised-fine-tuning-sft-for-several-projects-for-which-of/GfiyREFpoaIqqoSSWO7I</loc>
            <lastmod>2025-10-06T14:41:23.328Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-model-scaling-strategy/GjKg0jfEHHNRC5ZUiBDW</loc>
            <lastmod>2025-10-02T10:48:03.838Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/justifying-the-reference-policy/GkYIoFj2ZTA2mYXc2uFL</loc>
            <lastmod>2025-10-08T16:08:01.595Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-human-evaluator-is-reviewing-several-pairs-of-ai-generated-responses-to-a-users-prompt-below-are-d/GlJMsBZFxzGG5vTS2J6j</loc>
            <lastmod>2025-10-10T10:05:36.775Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-chatbot-development-strategy/Gm6hrGLOsjLblcxhbCQU</loc>
            <lastmod>2026-04-29T04:19:14.724Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-flawed-classification-prompt/Govx58XsDoumAuDBPyGd</loc>
            <lastmod>2025-10-09T03:20:08.926Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agents-policy-is-being-updated-using-an-objective-function-that-relies-on-importance-sampling-con/GpdnPz3k1QdgFNu8Zw4n</loc>
            <lastmod>2025-09-26T07:22:27.947Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-flawed-training-objective/GqCnaIQLjXjZK8oVGXrL</loc>
            <lastmod>2025-10-09T00:33:12.180Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-is-training-a-reward-model-using-a-small-preference-dataset-mathcaldr-which-contains-ex/GrbBNN62Uvx1o1XUoEn3</loc>
            <lastmod>2025-10-07T09:12:23.664Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-tells-a-conversational-ai-ive-had-a-persistent-dull-headache-and-have-been-feeling-unusually-/Grkfrl3fhi1HdruR2077</loc>
            <lastmod>2025-10-05T17:43:02.620Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-generates-a-cumulative-quality-score-for-a-text-as-it-is-built-from-four-sequential/GsOgJVWnB9cy0QZgArCl</loc>
            <lastmod>2025-10-08T15:59:41.070Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-deploys-a-large-pre-trained-language-model-for-its-public-facing-chatbot-due-to-immense-co/GsdH9HqY6TqdD8Naa6hn</loc>
            <lastmod>2026-02-08T13:19:58.676Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ranked-sequence-log-probability-calculation/GuJd0W3ft1XtLD4otIKD</loc>
            <lastmod>2025-10-04T04:52:33.589Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/model-parameter-selection-via-likelihood/GwUJhbj8xJ60j3OeNeAc</loc>
            <lastmod>2026-04-29T04:19:17.337Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-an-appropriate-language-model-training-objective/Gxb2FySyf0q7LCqunfO8</loc>
            <lastmod>2025-10-10T08:17:59.227Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-with-parameters-represented-by-is-translating-the-english-sentence-hello-how-are-yo/GxkBJxUdJCl2ITbvJIxJ</loc>
            <lastmod>2026-06-26T20:30:27.190Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-expression-sbarmathbfybarmathbfyk-where-s-is-a-function-that-operates-on-a-sequence-of-/GzairWSBnmv77WzJhd6M</loc>
            <lastmod>2026-06-30T00:53:26.406Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-following-equation-represents-the-primary-goal-of-a-common-model-training-process-match-each-mat/H025K7y6iRYxEa2DOlTV</loc>
            <lastmod>2025-10-04T01:40:54.171Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-action-in-different-reinforcement-learning-scenarios/H0Jvr7V4XZIumHKlduOJ</loc>
            <lastmod>2025-10-03T19:13:02.362Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-language-model-output/H2MVWCXHIH8ZHx8QysyV</loc>
            <lastmod>2025-10-02T23:50:11.914Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/true-or-false-when-training-a-reward-model-using-the-loss-function-l-ehumanscore-predictedreward-the/H2biQ3bSmX75aI50QOvm</loc>
            <lastmod>2025-10-08T23:27:50.955Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/concatenated-sequence-representation-for-multi-turn-dialogue/H4SpkSVYdpFyYNWEzqW8</loc>
            <lastmod>2025-10-07T15:17:25.303Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/practical-benefits-of-detailed-supervision-for-long-reasoning-paths/H5mRCJROr29OqtOxIB8Z</loc>
            <lastmod>2026-05-03T15:25:16.280Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sequence-of-cyclic-subgroups-notation/H6XsjQzjkf1xyJIdcHLZ</loc>
            <lastmod>2025-09-22T04:36:10.402Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-reinforcement-learning-training/H8MyZLFwOms2D5YQDkU8</loc>
            <lastmod>2025-10-02T06:46:33.160Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-performing-supervised-fine-tuning-on-a-pre-trained-language-model-the/H9F8Mt3yyh71wwMgfap3</loc>
            <lastmod>2025-09-28T02:01:26.542Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-to-classify-text-segments-as-either-appropriate-target-value-or-inap/H9HWXeb2CyG38epYxZrV</loc>
            <lastmod>2025-10-01T19:38:16.289Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-action-values-in-a-simple-environment/H9SRipD3ug39gUvr9DRB</loc>
            <lastmod>2025-10-04T03:26:39.719Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/representing-preference-data/HAO9lRNmBpdzpm6NlpqD</loc>
            <lastmod>2026-05-01T18:08:34.830Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-is-training-a-soft-prompt-denoted-as-sigma-to-mimic-the-behavior-of-a-full-context-c-fo/HAkdaGKsPEBfh5n9w9WR</loc>
            <lastmod>2025-09-26T16:06:52.529Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-is-operating-in-an-environment-where-taking-a-specific-action-in-a-gi/HAuW0TCh1xKpEUGlNNaW</loc>
            <lastmod>2026-06-26T13:50:43.956Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-reward-models-functional-shift/HBvaa9vEB6dHLbF00ZVk</loc>
            <lastmod>2025-10-06T03:20:26.584Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/insufficiency-of-data-fitting-for-complex-value-alignment/HGTBEV4KRcksYqZdDySA</loc>
            <lastmod>2025-10-06T12:38:18.438Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-policy-update-mechanisms/HHro9gMGhrwZVnJScsdv</loc>
            <lastmod>2025-09-28T23:59:40.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-training-a-reward-model-the-goal-is-for-the-models-output-r-to-be-as/HJBCGN5lCxEgC8XPrB1w</loc>
            <lastmod>2025-10-08T15:57:25.880Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-language-model-that-accurately-and-efficiently-follows-every-user-instruction-without-deviat/HKBa8OGRSXWq5i0eZhnh</loc>
            <lastmod>2026-04-29T04:19:17.908Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-has-a-single-powerful-pre-trained-language-model-they-need-to-adapt-this-model-for-te/HKP5zgDXRTz3rdc4DzSg</loc>
            <lastmod>2025-10-03T00:03:02.482Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-following-two-statements-from-different-mathematical-domains-in-a-paper-on-probabilisti/HPX0s5eMKy8QXr7IJpNs</loc>
            <lastmod>2025-10-09T00:11:19.771Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-a-language-model-for-mobile-deployment/HRosE7LrcJg0Z5DXGSxS</loc>
            <lastmod>2026-06-28T21:47:22.888Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/predicting-outcomes-of-cross-model-supervision/HRzeNtdTOjf7p9WsSbEL</loc>
            <lastmod>2025-10-06T11:37:24.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/re-weighting-a-reference-probability-distribution-with-a-scaled-reward/HS2qpCCqlLocScfflYzZ</loc>
            <lastmod>2026-06-22T17:52:29.148Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-role-of-the-reward-model-in-scalable-training/HT0xDH7wn4LEr6Hvxlth</loc>
            <lastmod>2025-10-03T06:13:27.404Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-policy-updates-in-reinforcement-learning/HU8YZxNa32vWonWJBoCd</loc>
            <lastmod>2025-10-03T02:59:37.743Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/greater-than-inequality/HUHZZTZxF76FzsUZKO1U</loc>
            <lastmod>2026-06-29T21:02:14.020Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/environment-in-the-context-of-llms/HWHkE48h0xR1LHsybwyQ</loc>
            <lastmod>2026-05-01T15:58:20.951Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-preparing-a-dataset-to-fine-tune-a-pre-trained-language-model-to-follow-specific-instructi/HYgUtpqyOWvKVTpSROgp</loc>
            <lastmod>2025-09-28T12:11:08.725Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-using-a-loss-function-calculated-as-the-negative-log-of-a-sigmoid-fu/HZlI69lSeqzunPP6JBh6</loc>
            <lastmod>2025-09-28T21:14:49.286Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-an-llms-ethical-alignment/HZvVtKbQdCfOuQlCVssz</loc>
            <lastmod>2025-10-06T11:33:23.880Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-learning-to-generate-a-five-sentence-summary-of-a-document-it-only-receives-a-final-qual/HamJUZwPgcnDyN6Pfww2</loc>
            <lastmod>2025-10-05T20:47:14.833Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-role-of-state-in-language-models/HbhKxpckpZym9VzusgLU</loc>
            <lastmod>2025-10-02T10:56:49.926Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-wants-to-receive-specific-actionable-guidance-to-resolve-a-technical-issue-they-are-facing-wh/HcqENfRJFW964tFqJQ81</loc>
            <lastmod>2025-10-02T04:05:14.394Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-small-student-model-by-learning-from-a-larger-teacher-model-the-training-o/Hf5oMW0nNmEozCQRprg4</loc>
            <lastmod>2025-09-26T06:14:02.170Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-human-feedback-for-model-alignment/Hfg2haseS1CYsUB80o9G</loc>
            <lastmod>2025-10-06T22:28:50.285Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-with-advantage-function-formula/HjMenBwzWE738MnoxzT9</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-machine-learning-strategy-with-limited-data/HkQRtahGFeWRykhGqza9</loc>
            <lastmod>2025-10-03T17:18:27.477Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-to-classify-text-segments-it-uses-the-following-loss-function-for-a-/HkgzsJXwPjLsQCO2zq59</loc>
            <lastmod>2025-09-28T21:09:59.417Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-preference-model-calculates-the-probability-that-a-winning-response-yw-is-preferred-over-a-losing-/Hn0TaVqxKhbUNd5fTl1K</loc>
            <lastmod>2025-10-03T19:47:30.287Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/manual-data-generation-for-instruction-fine-tuning/HpIci6yyp8JiXgBel0ug</loc>
            <lastmod>2026-05-01T00:57:08.661Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-adapting-a-large-language-model-for-a-specialized-task-to-minimize-computational-/HpVrbtU3sRNWZmr9feQJ</loc>
            <lastmod>2025-10-02T05:25:18.757Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-tasked-with-building-a-language-model-based-on-the-following-description-the-t/Hpgx7lmDbsxE4aTX4xJg</loc>
            <lastmod>2025-09-28T16:36:27.317Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/combined-reward-formula/Hpj1xJiNPcGYkaQYCZJl</loc>
            <lastmod>2026-05-03T00:22:56.590Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitation-of-relying-on-human-crafted-inputs-for-synthetic-data-generation/HrZvufszF0Y3e5mNgzZF</loc>
            <lastmod>2026-05-01T01:25:40.341Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-completes-a-task-which-consists-of-a-sequence-of-states-actions-and-rewards-s-a-r-s-a/HuwH4s8jXBXpfzIlffVp</loc>
            <lastmod>2025-10-07T04:39:11.429Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-training-of-a-language-model-the-policy-is-updated-based-on-a-clipped-objective-function-/HvJ0ybDeSTCMbmc6gyvS</loc>
            <lastmod>2025-09-28T22:57:07.383Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-with-a-supervised-objective-to-maximize-the-probability-of-the-cor/HvyUxykZ5040LqdwS55z</loc>
            <lastmod>2025-10-02T02:12:22.232Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-e-commerce-company-is-developing-a-customer-service-chatbot-using-multiple-specialized-reward-mod/I1w29WcPI3eVjUNjNSZE</loc>
            <lastmod>2025-10-07T10:06:22.048Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-predictive-accuracy-for-financial-fraud-detection/I2q698GnRlklXF8Cs2jj</loc>
            <lastmod>2025-10-02T20:03:36.192Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/potential-inefficiency-of-scaling-instruction-fine-tuning-for-generalization/I3GFrHs1GNgXwdBPnYgZ</loc>
            <lastmod>2026-05-01T11:11:02.125Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generalization-in-instruction-alignment/I3UjGxGDao7NneYeOos1</loc>
            <lastmod>2025-10-06T12:56:06.803Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/general-notation-for-conditional-probability-models/I3eS33rn8Tzl4u99IHbe</loc>
            <lastmod>2026-04-29T16:07:26.027Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-mathematical-component-from-the-policy-learning-objective-function-with-its-conceptual-ro/I42cFzYjQ8DErols0MDI</loc>
            <lastmod>2025-10-08T20:23:35.812Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-combined-reward-for-policy-supervision/I4hxJn5XPBfJuIJquTQr</loc>
            <lastmod>2026-05-03T00:23:09.073Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-specialized-chatbot-to-answer-questions-about-a-companys-internal-financial-p/I4jUy0WlDjcYXf5yFnBx</loc>
            <lastmod>2025-09-26T06:22:29.230Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-diverse-data-to-steer-llm-specialization/I7TA6HBlrRCH85EP6joP</loc>
            <lastmod>2026-05-01T14:40:21.776Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-the-arg-max-prediction-strategy/I8PUsgCNlAeeDBGxW2kp</loc>
            <lastmod>2025-10-08T16:42:45.270Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-model-generalization/I9tMaDWjDV2nfUWGLX8g</loc>
            <lastmod>2025-10-06T23:15:11.427Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/importance-and-demand-for-instruction-fine-tuning-datasets/IBWEbhFhIn7HVt4DVOmH</loc>
            <lastmod>2026-02-08T13:56:44.592Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-long-range-failures-in-a-segment-processed-llm-with-dual-memory/IBrwoltSi8ZaoXalPEa5</loc>
            <lastmod>2026-02-06T18:30:57.017Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-models-output-is-only-considered-reliable-if-its-uncertainty-score-is-strictly-sm/IFdl8LczSGOX7zmkZus8</loc>
            <lastmod>2025-09-28T22:31:32.882Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-designed-to-evaluate-the-quality-of-a-specific-sentence-within-a-longer-ai-generat/IGEgCLAbUktu249lqVSU</loc>
            <lastmod>2025-10-06T18:53:11.245Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-is-building-an-internal-model-that-must/IJ4e3xnkTbImnp3hMCf5</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/state-in-the-context-of-llms/IORNwrho6uZmZb2QgoH4</loc>
            <lastmod>2026-05-01T15:56:15.713Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/general-formula-for-prediction-via-maximum-probability/IP2UCXA0cYoOzS6q0p8A</loc>
            <lastmod>2026-07-03T23:21:45.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-theorem/IRzliywe5EvgT99sIMU5</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/heuristic-based-deletion-for-prompt-simplification/ITlM4bqJ0QdUJqo8WPPQ</loc>
            <lastmod>2026-04-30T22:47:36.027Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-reward-structures-in-ai-training/IWbxIghTARNX8WShIq1Z</loc>
            <lastmod>2025-10-10T08:09:03.938Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formal-representation-of-an-instruction-tuned-llm/IXPRQ8zkrjiB71rUp9d2</loc>
            <lastmod>2026-05-01T10:46:09.286Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-using-an-ensemble-of-three-separate-models-to-evaluate-a-single-generated-/IYuXvIy1JuatPZMe4P9g</loc>
            <lastmod>2025-10-01T19:34:33.779Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-log-probability-for-a-ranked-list/Ib9eWE0mLuR4HRpT4Me7</loc>
            <lastmod>2025-10-08T23:41:17.921Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-comprehensive-strategy-for-guiding-a-language-models-behavior-requires-addressing-several-distinct/Iby2d2PkTR8KglFnGMo2</loc>
            <lastmod>2026-02-08T13:25:35.889Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-overfitting-in-weak-to-strong-fine-tuning/IcegPBYJu5gibXLt5uFr</loc>
            <lastmod>2025-10-04T03:28:51.420Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/principle-of-automated-prompt-refinement/IdH27vZn25iuEsz2s06X</loc>
            <lastmod>2025-10-06T14:43:04.271Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-constant-reward-function/IhEmJr0Fl523HmY47wGy</loc>
            <lastmod>2026-07-01T02:56:40.101Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-reward-model-feedback-for-scientific-summaries/IhsbKfmZYAiWabUbr9PJ</loc>
            <lastmod>2025-10-06T19:06:29.408Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-model-is-tasked-with-classifying-the-sentiment-of-a-sentence-as-either-positive-or-negative-it-fir/Iiv6q9gzZZePAlb1DkMH</loc>
            <lastmod>2026-06-28T12:18:15.729Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reference-policy-in-dpos-penalty-term/IjDbSKgbGDzVmLJA33F6</loc>
            <lastmod>2026-06-28T15:37:40.406Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-is-using-a-combined-objective-to-train-a-small-student-model-the-goal-is-to-/IllcL8Zn56Pt5B88Jzlp</loc>
            <lastmod>2025-10-08T15:16:25.646Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/tuning-an-rlhf-ppo-update-when-reward-improves-but-behavior-regresses/ImdBMfgaaIj1AvXj9Anr</loc>
            <lastmod>2026-02-06T17:03:11.530Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-reinforcement-learning-agent-being-trained-for-a-specific-state-action-pair-the-ratio-of-/IoGgFqHhRlZXIafa81Q1</loc>
            <lastmod>2025-10-08T14:59:37.502Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-prompt-engineering-strategy/IsLfETrGNPWNwSOuo7JC</loc>
            <lastmod>2025-10-06T18:27:57.588Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-supervised-fine-tuning-if-a-model-is-trained-on-concatenated-input-output-sequences-and-the-t/IuZbxabfpQZ4BAdyZONQ</loc>
            <lastmod>2025-10-03T01:42:21.380Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-fine-tuning-strategies/IvViRvgbYsaokNMBFe6t</loc>
            <lastmod>2026-02-08T14:06:51.975Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/to-measure-the-weak-to-strong-performance-pweakstrong-of-a-powerful-model-a-specific-sequence-of-act/IveTfzFGnUZ1pqWgrsK0</loc>
            <lastmod>2025-10-07T12:09:10.806Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/historical-precedent-of-self-generated-data-in-nlp/IycOodqplJWl6BGsAqHq</loc>
            <lastmod>2026-05-01T10:21:23.186Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-building-a-reward-model-to-assess-ai-generated-responses-that-explain-a-complex-scientific/IzOGSlj5B12krELltQYn</loc>
            <lastmod>2025-10-01T19:09:00.823Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-fine-tunes-a-large-language-model-to-be-a-helpful-assistant-for-summarizing-legal/J1M7Z3kcWMGYi611k4zA</loc>
            <lastmod>2026-02-08T14:04:46.430Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-loss-calculation/J1wSLUz6FGWHqvrLu4r5</loc>
            <lastmod>2025-09-29T01:28:46.964Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-plans-to-generate-a-large-dataset-to-train-a-language-model-their-method-inv/J27hkHPuhq5nNx1RTq7X</loc>
            <lastmod>2025-10-01T19:35:19.419Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/language-model-as-a-stochastic-policy/J2Lf6hpEHxWQb1rInQPk</loc>
            <lastmod>2025-10-07T15:29:40.771Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/key-attributes-of-effective-sft-datasets-and-their-impact-on-llm-performance/J2hVoq6WQw6WGiY2cDZN</loc>
            <lastmod>2025-10-06T13:15:41.792Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/framing-the-process-of-fine-tuning-a-powerful-model-with-labels-from-a-weaker-model-as-a-form-of-kno/J2sUuLZ6LejjHajTs9BI</loc>
            <lastmod>2025-10-10T08:54:38.731Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-wants-a-large-language-model-to-write-a-short-professional-biography-for-a-software-engineer-/J35jvOz8ce56omfWlyH3</loc>
            <lastmod>2025-09-28T18:52:15.504Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-training-a-reward-model-on-segment-level-scores-using-a-regression-loss-the-primary-objective-i/J3ehF6uEpjT4quhuH8ob</loc>
            <lastmod>2025-10-10T06:34:24.778Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-estimation-for-ac-with-a-reward-model/J7A60xMjwVPvtktmNxp5</loc>
            <lastmod>2025-10-06T19:40:30.652Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/inarticulacy-of-human-preferences-as-an-alignment-challenge/J9D5ONTneZc9JaOYP4uI</loc>
            <lastmod>2026-04-20T00:08:34.293Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-function-that-assigns-a-constant-positive-value-eg-to-every-segment-of-a-generated-text-is-/JE7PzGUvkTna8Ie6plXL</loc>
            <lastmod>2025-10-10T02:46:36.036Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-training-an-agent-and-has-a-policy-represented-by-parameters-current-to-evaluate-/JEO8zUuHbPVFDEfDy55g</loc>
            <lastmod>2026-06-29T07:14:54.434Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-proportional-to-exponentiated-reward/JHe61Ul9WInJTyFdugLp</loc>
            <lastmod>2026-06-27T16:03:42.734Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-gradient-algorithm-the-update-for-the-policy-parameters-is-influenced-by-the-term-r-b-wh/JHquA8nP7MiCtkMAuklN</loc>
            <lastmod>2025-09-26T15:49:38.591Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-ppo-training-strategy/JLSF6BOXjbt9avWE9Ycm</loc>
            <lastmod>2025-10-06T00:32:18.640Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critiquing-a-reward-function-for-maze-navigation/JMHdFrdhXJmthhoaTFdD</loc>
            <lastmod>2026-05-01T16:24:16.966Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimal-reward-model-parameter-estimation/JNDow0AYj553Vdp1Hpvq</loc>
            <lastmod>2026-05-01T18:02:42.597Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-simple-predictive-model-is-defined-by-the-function-output-weight-input-weight-input-bias-during-th/JNOFS6F0OZBAS1mg5f0O</loc>
            <lastmod>2025-09-28T17:43:08.235Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-and-correcting-llm-behavior/JOCIcKFRJjelFr1wVd9L</loc>
            <lastmod>2025-10-03T01:40:12.105Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/which-of-the-following-best-analyzes-the-primary-reason-why-direct-policy-optimization-dpo-is-consid/JOwyDeGaourbYJ0NLNqG</loc>
            <lastmod>2025-10-05T23:39:15.553Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-a-hybrid-training-objective/JPP08CiOw4gxd0axYVEy</loc>
            <lastmod>2025-10-06T01:03:20.892Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-wants-a-language-model-to-consistently-translate-informal-text-messages-into-a-formal-pr/JSDsGD5HmH6HKyB4fsY2</loc>
            <lastmod>2026-04-29T04:14:33.359Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-prompt-effectiveness-for-summarization/JTO4XzeFEzZCNpjbRMne</loc>
            <lastmod>2025-10-09T02:28:39.298Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-fine-tuning-a-large-language-model-the-active-model-to-improve-its-performance-on-a-specif/JVeFw5v7djElpiCD4Fqc</loc>
            <lastmod>2026-06-26T01:24:44.354Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-pipeline-uses-a-small-model-to-select-high-quality-data-for-training-a-larger-mod/JViG4ua03VRoO0Ne9C5x</loc>
            <lastmod>2025-10-06T11:31:56.386Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-rationale-for-universal-models/JVv7CNggp13vQ3JCnuqT</loc>
            <lastmod>2025-10-06T22:21:06.185Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/annotation-feasibility-for-a-legal-ai/JXxiXBGtjgZskZVgbfC6</loc>
            <lastmod>2025-10-06T22:30:09.431Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dataset-strategy-for-model-specialization/JZvPgZ5GmUgjzLdoOQo3</loc>
            <lastmod>2025-10-02T18:37:18.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-a-shaped-reward-function/Ja53uRkE8tsdpdj5e3in</loc>
            <lastmod>2026-06-26T13:50:43.956Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-ai-feedback-and-human-feedback-for-llm-alignment/JbqN0TgXUyYOq7puXYQJ</loc>
            <lastmod>2026-05-03T01:11:35.578Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-aspect-based-sentiment-analysis/Jcqvp2zza90GDZu4WkGc</loc>
            <lastmod>2026-05-02T23:58:34.053Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-agent-environment-interaction-loop-in-reinforcement-learning/JeeaBYi6m6HY4BPAcIbQ</loc>
            <lastmod>2025-10-10T04:17:49.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-interacts-with-an-environment-for-a-total-of-t-time-steps-resulting-in-a-sequence-of-states/Jeusppf4s2ZUwxv2UxFt</loc>
            <lastmod>2025-10-07T15:34:39.981Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-reward-model-instability/Jf9rHMP5HEMjnxbIyc3n</loc>
            <lastmod>2025-10-05T22:33:16.383Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/performance-paradox-of-a-student-llm-trained-by-supervisor-llms/JhfyiPQ2KSKZvki49Fi6</loc>
            <lastmod>2026-05-03T00:25:16.257Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/application-of-segment-based-total-reward-in-policy-training/JjkirMhWMki6ku9S4ByA</loc>
            <lastmod>2025-10-07T00:06:21.806Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-policy-as-a-probability-distribution/JkD87ilkOhfrLvHujgXK</loc>
            <lastmod>2026-06-26T20:30:30.142Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-uses-a-sentiment-analysis-model-that-provides-a-single-overall-score-for-each-customer-rev/JmOJlCZgvLD2UCThACJl</loc>
            <lastmod>2025-10-04T08:02:15.206Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-scenario-where-a-language-models-response-is-broken-into-segments-for-evaluation-a-human-review/JmU87JRWkRJgoQ9v76bm</loc>
            <lastmod>2025-10-08T16:56:49.201Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-is-interacting-with-a-customer-support-model-for-an-e-commerce-site-consider-the-following-tw/JnOjB7Yx4Wl1eb6wR5RG</loc>
            <lastmod>2025-10-07T11:58:53.607Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-key-step-in-deriving-policy-based-reinforcement-learning-algorithms-involves-transforming-the-grad/JnPinGlSblUwFx3mUNjG</loc>
            <lastmod>2025-10-03T19:53:13.526Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-using-a-surrogate-objective/JnYcwSVk9fc7obVogpG8</loc>
            <lastmod>2025-10-07T15:39:56.772Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-inconsistent-fine-tuning-performance/JsPCPF1Q0sCP1o6oVuHy</loc>
            <lastmod>2025-09-26T06:59:02.857Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-utility-function-that-modifies-the-policy-probability-ratio-rt-using-the-operation-minrt-is-primar/JzUTk3V9i1utiOymbFpX</loc>
            <lastmod>2025-10-03T20:04:19.887Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-cumulative-past-rewards/JzsSZXJ6bHFAtkbktMH5</loc>
            <lastmod>2025-10-08T14:45:13.492Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-provides-the-following-input-to-a-large-language-model-my-five-year-old-has-a-fever-of-f/Jzw4UcO4gNCHhLRArjoV</loc>
            <lastmod>2026-02-08T13:12:10.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-model-update-notation/K1DSPgyUxCM8rWCfvi4g</loc>
            <lastmod>2025-10-08T20:07:38.095Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-the-last-token-reward-calculation-method/K1HdIJ0ew1rqktWRCL9Y</loc>
            <lastmod>2025-10-03T21:38:34.673Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-and-justifying-a-long-context-memory-design-for-a-regulated-audit-assistant/K3RaLJSWa2wYN5lQjiNX</loc>
            <lastmod>2026-02-06T18:31:15.567Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/solution-as-a-sequence-of-reasoning-steps/K6WSBvDn71sEBaqjA2bF</loc>
            <lastmod>2026-05-03T01:24:01.713Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/superficial-alignment-hypothesis/K70jmfT2MCsNVDuszMbU</loc>
            <lastmod>2026-05-01T10:35:35.228Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-an-llm-adaptation-strategy/K85vZNaCU8AqkDxRg7MK</loc>
            <lastmod>2025-10-10T09:12:49.821Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/state-in-reinforcement-learning/K9C7lC45NypDY0xG4env</loc>
            <lastmod>2025-10-06T17:57:00.159Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-one-step-of-the-final-fine-tuning-stage-for-a-large-language-model-the-model-is-given-an-inpu/KAKSQW9UoZjRHglQXHfa</loc>
            <lastmod>2025-10-08T23:31:17.180Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/assessing-step-quality-beyond-correctness/KDlhichlAlpmjvM7NKhm</loc>
            <lastmod>2026-05-03T15:21:21.568Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-objective-function-for-rl-fine-tuning/KDlmaGSlRIlskFIFEjDP</loc>
            <lastmod>2026-06-25T20:40:21.311Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rearrangement-of-the-assumed-dpo-objective/KDyIgMeO2W7H5Noj2PSa</loc>
            <lastmod>2026-05-03T00:44:14.012Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/environment-in-reinforcement-learning/KFPydxlWs2WXrpqDOQwn</loc>
            <lastmod>2025-10-06T13:32:41.724Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-language-model-to-generate-helpful-cooking-recipes-they-use-a-single-reward-mod/KFQTZq6uRJ8Ou2pWee5H</loc>
            <lastmod>2025-09-28T17:48:43.452Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/symptoms-that-call-for-medical-attention/KHkGjuMmlc7clv4holp1</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-updating-a-policy-using-an-objective-function-with-importance-sampling-if-the-rati/KIz4vNhhA9iB9BLiXwCx</loc>
            <lastmod>2025-10-08T15:30:44.479Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-models-ability-to-generalize-to-new-tasks-is-evaluated-using-a-set-of-new-instruction-inp/KLpNNvcwCSobLZU4DnS4</loc>
            <lastmod>2026-05-01T10:47:02.097Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/alignment-as-a-segment-classification-problem/KMmU6yCKde4Evx2FATi3</loc>
            <lastmod>2026-05-03T00:08:54.591Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/examples-of-constrained-prompts-for-text-summarization/KMrNMzn6hYNgN1IkrhuW</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/preference-probability-calculation/KNHtM8t1XRmu2v3Vs4t8</loc>
            <lastmod>2025-10-07T09:39:22.374Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/notational-variations-in-state-action-sequences-trajectories/KNZmBoETC8zKDo4giSZV</loc>
            <lastmod>2025-10-07T15:34:48.079Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/notation-for-the-rlhf-reward-model/KNwee7raMMQVAcz4P3bv</loc>
            <lastmod>2026-06-28T15:52:10.048Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generalizing-ai-input-optimization/KOGGv7Yzno2PxXBJ8W4O</loc>
            <lastmod>2025-10-05T17:33:47.515Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/high-variance-in-policy-gradient-estimates/KP8PSgzeVeITrBN3xPvB</loc>
            <lastmod>2026-05-01T16:24:59.775Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-llm-performance-issues/KPH4juhPr82FpCIE0z2l</loc>
            <lastmod>2026-04-30T23:33:48.347Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/balancing-accuracy-and-safety-in-model-responses/KPsYk4GmrHf78Pb3DSs9</loc>
            <lastmod>2026-02-08T13:19:09.707Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sft-objective-as-maximizing-joint-log-probability-of-concatenated-sequences/KQxcZ74JmNdaLNZiahc2</loc>
            <lastmod>2026-05-01T00:25:29.182Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/utility-of-weak-models-in-assisting-stronger-models/KTDuH6TTKVBTsrsM9VQz</loc>
            <lastmod>2026-05-01T15:09:38.258Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/demonstration-of-promptings-power-with-large-scale-models/KURyg2fCUQLO093VCQsr</loc>
            <lastmod>2026-04-30T22:56:35.827Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-policy-divergence/KViIdQybbyUTmwrs9JEs</loc>
            <lastmod>2025-10-09T00:25:06.186Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/cost-effectiveness-of-instruction-fine-tuning-for-generalization/KWAqxeqmLVCpwdE1ey1v</loc>
            <lastmod>2026-02-08T13:56:22.365Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/trade-off-between-efficiency-and-flexibility-in-soft-prompts/KWd4mgM319w3Fq7KcKeO</loc>
            <lastmod>2025-10-10T07:44:57.509Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generalization-challenges-in-instruction-fine-tuning/KXTRrK3vxrwEgF5Pu0gx</loc>
            <lastmod>2026-05-01T10:52:51.104Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/objective-of-supervised-fine-tuning/KYwUeqI70ubr8FXcilnq</loc>
            <lastmod>2026-06-17T21:20:17.201Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-using-an-objective-function-that-aims-to-maximize-the-value-of-l-s-r/KaqRLrnUKmqwW7TnOknU</loc>
            <lastmod>2025-10-07T08:08:27.901Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/correcting-a-flawed-fine-tuning-objective/Kb0nGOYN61I5Kzoc0gfl</loc>
            <lastmod>2025-10-02T11:27:09.167Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rejection-sampling-for-llm-fine-tuning/KccgwQodLPzOTmqGzDOH</loc>
            <lastmod>2026-05-03T15:36:29.279Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-learning-agent-interacts-with-its-surroundings-in-a-cyclical-process-to-achieve-a-goal-arrange-the/KdEvn4ddapxK6l2UMqRt</loc>
            <lastmod>2025-10-05T20:07:34.002Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-system-design-for-a-summarization-agent/Ker3Mw6RxbrIrvPz6Ws2</loc>
            <lastmod>2025-10-05T23:33:50.570Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-gives-a-language-model-the-following-instruction-and-textinstruction-summarize-the-following-/Kh1jwMlORrYreYkD19XD</loc>
            <lastmod>2025-09-26T01:42:30.887Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-fine-tuning-outcomes/Ki8yOxbAanLuCsg9RUA8</loc>
            <lastmod>2025-10-02T21:45:55.484Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-automated-system-for-creating-training-data-has-just-generated-a-new-instruction-summarize-the-pr/KjJRotDY75JPajGIOnd3</loc>
            <lastmod>2025-10-05T22:08:48.071Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/parameter-selection-via-loss-minimization/KkzbFcBX5Ouyjyk0smFO</loc>
            <lastmod>2026-04-29T04:19:17.787Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/segment-evaluation-methods/Ko0aWxtrxTutdXJKAIJV</loc>
            <lastmod>2025-10-02T11:22:34.096Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-extensive-knowledge-base-acquired-by-a-large-language-model-during-its-pre-training-on-a-massive/KoqMnKtyvlTqjORbZRP3</loc>
            <lastmod>2025-10-10T07:20:42.231Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-mathematical-proof-demonstrating-that-a-state-dependent-baseline-bst-does-not-introduce-bias-/KrtgUd5J94zkwkknfdFH</loc>
            <lastmod>2025-10-06T19:46:40.425Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-flawed-prompt-for-instruction-generation/KtDwcNtiCZQ75oLdR6Xn</loc>
            <lastmod>2025-10-10T03:19:06.088Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-to-fill-in-a-masked-word-for-the-input-the-cat-sat-on-the/KtJFkZeDEx45g0UQ5J99</loc>
            <lastmod>2026-04-29T03:51:54.727Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-using-supervised-fine-tuning-on-a-pre-trained-language-model-to-create-a-speci/KuPUDPRYCZwNWaSk3yE6</loc>
            <lastmod>2025-10-02T08:33:06.191Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/visual-diagram-of-an-ensemble-of-multiple-small-models/KuhHfpi9wpvO1zHounPM</loc>
            <lastmod>2025-10-09T02:32:26.294Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-restaurants-feedback-system-analyzes-customer-reviews-and-assigns-a-single-overall-sentiment-score/L0SbpYERxS9cTF0kh1DC</loc>
            <lastmod>2025-10-07T04:35:10.816Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critiquing-trajectory-notations/L1aTMrzP3jmZk2vNEMRV</loc>
            <lastmod>2025-10-03T16:28:39.596Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/derivation-of-the-bradley-terry-preference-formula/L3DmXpPdbkipyYPJaMg1</loc>
            <lastmod>2026-06-27T16:21:32.287Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-state-function-impact-on-sequence-generation/L4CN4V0Y1uOO7789vwAt</loc>
            <lastmod>2025-09-26T06:42:33.224Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-llm-generalization-by-diversifying-tasks-and-instructions/L5X7yDRVKxYsf7azXr7W</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/counting-occurrences-in-a-state-action-multiset/L6VLGW1IUJGbzF53d02g</loc>
            <lastmod>2025-10-10T01:31:37.298Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-refining-a-pre-trained-language-model-using-a-dataset-of-human-preferences/L7DLz28nTxJpTzwP2TDF</loc>
            <lastmod>2025-09-26T11:59:41.314Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-heuristic-based-simplification-outcomes/L8w0tqYqrR7arrPvRcmb</loc>
            <lastmod>2025-10-05T17:30:13.778Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-language-model-to-function-as-a-specialized-customer-support-cha/LCGzyhyDAslW2QDgmQOY</loc>
            <lastmod>2025-09-26T01:19:43.829Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reinforcement-learning-from-human-feedback-rlhf/LDtSme7rkSs2c9cI9maL</loc>
            <lastmod>2026-05-15T07:46:43.508Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-as-an-imperfect-environment-proxy/LEBh2dsfL3tV2Z1BQsrw</loc>
            <lastmod>2026-05-03T00:17:36.673Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-alignment-in-autonomous-driving/LEMRMv88wf6BaAtjHnEy</loc>
            <lastmod>2026-05-03T15:46:20.716Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-wants-to-enable-a-new-large-language-model-to-perform-high-quality-sentiment-anal/LFKUVCAKJtco3IJMoHF9</loc>
            <lastmod>2025-10-05T18:58:33.631Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-with-a-loss-function-that-includes-a-regularization-component-this-c/LHnfvImlsfEPzCopHW3u</loc>
            <lastmod>2025-10-04T04:14:53.864Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-for-ranking-text-responses-first-assigns-a-numerical-reward-score-to-each-response-and-then/LI3eTRJ1xmWTc0rRbO2b</loc>
            <lastmod>2025-10-02T02:08:37.873Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/components-of-the-rlhf-objective-function/LI4G1eSM5SNzHQ9dBXUz</loc>
            <lastmod>2025-10-06T11:31:10.583Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-reward-model-using-human-feedback-instead-of-collecting-simple-pairwise-compari/LKlUlZx1uJNWxwZm1rfE</loc>
            <lastmod>2025-10-01T18:39:43.138Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-knowledge-distillation-hyperparameter/LR7vUSoA50oxcLDzqoBl</loc>
            <lastmod>2025-10-03T20:59:07.075Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/need-for-diverse-alignment-methods/LRFN9DCkYdZRdP6R2DtW</loc>
            <lastmod>2026-02-08T13:31:42.588Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-trying-to-make-their-instructions-for-a-language-model-more-efficient-below-is-their-/LRgjBF9f1841NQmB5QWq</loc>
            <lastmod>2025-09-26T04:11:05.213Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-interacts-with-an-environment-over-five-time-steps-and-receives-the-following-sequence-of-r/LU2A9t3Q8rY3hotB6jQz</loc>
            <lastmod>2025-09-26T15:25:45.095Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-a-flawed-ai-training-objective/LW3cYatOGeOfENYCTx29</loc>
            <lastmod>2025-10-07T04:25:31.826Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-prompt-generation-workflow/LWgXgGGPTdWsvjrmbve8</loc>
            <lastmod>2025-09-26T05:12:39.773Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-a-customer-support-chatbot/LWgaMg5A5c9xEqzEvNcX</loc>
            <lastmod>2025-10-10T10:08:33.666Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-policy-model-is-being-trained-to-generate-summaries-each-generated-summary-is-broken-down-into-thr/LXaUbOvgnfZCNSbhUUwg</loc>
            <lastmod>2025-09-26T12:32:54.744Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-implements-a-two-stage-system-to-handle-customer-queries-for-cost-efficiency-in-the-first-/LZ6fG7UVu1LGZfzaD3da</loc>
            <lastmod>2025-10-02T03:37:28.278Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fine-tuning-llms-for-context-representation-tasks/LZNntKF0cR8rUW8OsVm5</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-models-prediction-choice/LZrOznXez5XxFEnlpIhn</loc>
            <lastmod>2025-10-08T16:17:29.151Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-an-llm-alignment-failure/LamJRrPeTuOr7L8ZG07S</loc>
            <lastmod>2025-10-05T17:29:29.389Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/youre-deploying-an-internal-llm-assistant-that-mu/LatSVoHJK3wSSpHlz660</loc>
            <lastmod>2026-02-06T18:32:02.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/trust-region-policy-optimization/LbT5GwrlmkN7GlNDiSQ8</loc>
            <lastmod>2026-07-11T17:53:50.618Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-undesirable-behavior-in-policy-optimization/LcfiwaHGrgQ215afiLAJ</loc>
            <lastmod>2025-10-08T15:32:20.587Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-an-objective-function-for-stable-policy-updates/LcsXNZQmGVYq36YL9sj6</loc>
            <lastmod>2025-10-06T01:37:57.711Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-an-optimization-strategy-for-soft-prompts/LcuvNfZsgwvBG4gRxm1j</loc>
            <lastmod>2025-10-06T00:12:57.734Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-flawed-simplification/LejSKJ9602SdhJQPhLAg</loc>
            <lastmod>2025-10-03T05:16:00.532Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-as-an-imperfect-proxy-for-the-environment/LheL4td1eCuCX3ADV74h</loc>
            <lastmod>2025-10-07T10:03:41.718Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-process-that-sequentially-ranks-a-set-of-five-items-a-b-c-d-e-the-final-observed-ranking/LjKMPdqJ0eYDmpRUnSXp</loc>
            <lastmod>2025-10-01T23:01:14.283Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-fine-tuning-a-language-model-on-two-different-tasks-for-which-of-the-following-ta/LlUdIlUzlTSStxXa5i7y</loc>
            <lastmod>2025-09-28T23:26:02.413Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-initiating-a-process-to-enhance-a-language-models-ability-to-generate-python-code/LmVTulLu7xcAoUvioVfD</loc>
            <lastmod>2025-09-26T08:29:17.712Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-a-multi-model-reward-system/Lmat5M0kG3KOS04dPGal</loc>
            <lastmod>2025-09-28T15:20:18.949Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-mathematical-formulation-for-direct-policy-optimization-dpo-is-derived-from-a-principle-that-inv/Lmf3WPw1tjNqEj6C8z95</loc>
            <lastmod>2025-09-28T18:33:27.781Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-minimal-data-fine-tuning/Lmx3h43D272rQViPjF0t</loc>
            <lastmod>2025-10-10T02:30:52.470Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-optimizing-a-policy-to-match-an-optimal-policy-the-objective-function-is-often-simplified-from-/LnKbKJPcVbEdA3RN50Ee</loc>
            <lastmod>2025-09-28T23:55:30.595Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-technology-company-is-developing-a-large-language-model-for-public-use-their-alignment-strategy-co/LooDzQuIMsEHTO4Xdv8X</loc>
            <lastmod>2026-02-08T13:25:30.245Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-training-a-reward-model-where-the-goal-is-to-align-the-models-predict/Lq5iZm4QP9n3XP1rZcVW</loc>
            <lastmod>2025-10-02T02:19:08.836Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/explaining-the-role-of-fine-tuning/LqetbwU6qU39cGSrX6b0</loc>
            <lastmod>2025-10-08T14:13:50.806Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-aligning-a-large-language-model-using-reinforcement-learning-with-human-feedback-a/LuV9XV5MVbGqF6yDzOxd</loc>
            <lastmod>2025-10-06T03:02:09.489Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyze-the-following-prompts-and-match-each-one-to-the-primary-task-it-is-designed-to-elicit-from-a/M01okSNeJ1lJfsptqkHq</loc>
            <lastmod>2025-10-06T16:29:32.882Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-template-based-text-generator/M0GLCM8DOHQooDoGiYLT</loc>
            <lastmod>2025-10-03T00:17:07.280Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-an-expert-annotation-plan/M0yD9uSHL0wLkdQkSeZw</loc>
            <lastmod>2025-09-29T12:03:26.800Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-preparing-a-dataset-for-a-human-feedback-based-model-tuning-process-the-initial-/M1wGTVPm4i54pIImUFul</loc>
            <lastmod>2025-10-07T10:07:02.410Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-executes-an-identical-sequence-of-states-and-actions-in-two-different-environments-a-and-b-/M2J1joDOO1ySRQAb2ez7</loc>
            <lastmod>2025-09-26T06:59:43.868Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-feedback-method-for-a-reward-model/M34yrNzXU1QzuR0OjmLD</loc>
            <lastmod>2025-10-02T05:16:03.134Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-human-labeler-is-tasked-with-providing-feedback-on-two-different-ai-generated-summaries-of-an-arti/M3dBN3Iocn0hhWIP1Xeo</loc>
            <lastmod>2026-05-01T18:08:34.830Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-fine-tuning-a-pre-trained-language-model-and-observes-several-undesir/M4Fxi2eFwuAdGFu4P8Tn</loc>
            <lastmod>2025-10-10T10:25:02.241Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/overoptimization-problem-in-reward-modeling/M5Ou0xy7kJK3AFoDCYtb</loc>
            <lastmod>2025-10-07T00:06:10.346Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/surpassing-the-supervisor/M6agwTdLgOrUxIpRX96w</loc>
            <lastmod>2025-10-10T02:47:21.003Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-framework-of-learning-a-soft-prompt-via-knowledge-distillation-to-compress-a-longer-context-m/M6ln5lDZgPdF4V3pXcZP</loc>
            <lastmod>2025-10-07T00:20:23.740Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/nature-of-an-llms-policy/M8MgxlAc28fbEH2aPsYx</loc>
            <lastmod>2025-10-07T11:41:46.314Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-acquisition-strategy-for-a-new-ai-application/MAelTm5qOayHVmh0wDlr</loc>
            <lastmod>2026-02-08T14:32:28.805Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-annotation-methods-for-human-feedback-in-rlhf/MEz71e3GZMasV3RcnnwV</loc>
            <lastmod>2026-06-30T17:00:36.647Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-fine-tuning-strategy/MFra9UMWgG13czf68eMO</loc>
            <lastmod>2025-09-26T07:37:39.091Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-the-oracle-reward-model-for-urban-planning/MH3sBLX2aicYxIqbsNGa</loc>
            <lastmod>2025-10-06T02:39:08.991Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-a-text-simplification-model/MH6XJqKUQNei1G7wmaUe</loc>
            <lastmod>2025-10-05T12:20:19.668Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/importance-sampling-for-utility-estimation-in-policy-gradients/MI8AEPoZPPGxaxEnY3rt</loc>
            <lastmod>2026-06-17T21:33:08.508Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/balancing-candidate-quality-and-diversity-in-reranking/MNkSzaR9ppDqYZezHHyY</loc>
            <lastmod>2026-05-03T15:35:55.797Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/architecture-and-function-of-the-rlhf-reward-model/MOWNvWykKfxG59eDMKQB</loc>
            <lastmod>2026-05-02T23:18:25.829Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-notation-in-a-medical-ai-context/MRHyBcER7SfumH3KNVmO</loc>
            <lastmod>2025-10-08T21:08:36.735Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-technical-support-prompt/MV9acDgtZa2vmFKGImjj</loc>
            <lastmod>2026-02-09T19:44:55.160Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-divergence-between-distributions/MWg6IGBtL8TmbsKx3ORM</loc>
            <lastmod>2025-10-03T16:57:49.203Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reinforcement-learning-process-for-llms/MWyGJWHhuKdtIetEOMDo</loc>
            <lastmod>2026-05-01T16:06:15.846Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/predictive-inference-by-maximizing-conditional-probability/MWyqEoj6E5GFtlVy5N7x</loc>
            <lastmod>2026-06-18T19:59:20.756Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/process-based-vs-fine-grained-reward-modeling/MXkHmveFUBwtZU7mJs50</loc>
            <lastmod>2026-05-03T15:21:57.365Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-constrained-vs-unconstrained-model-training/MZKPsLK9DwOG652LgHxG</loc>
            <lastmod>2026-06-26T01:24:44.354Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ethical-and-safety-challenges-in-llm-alignment/MZQzk9upG0fAI8GsXHiv</loc>
            <lastmod>2025-10-05T00:53:35.537Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/identifying-reward-model-inputs-and-output/MZl2sWpy7CknpE6VcMCR</loc>
            <lastmod>2025-10-06T18:32:12.430Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-on-a-dataset-containing-a-mix-of-very-short-sequences-and-a-few-ex/MbGiA6QQDK8LImxu77rb</loc>
            <lastmod>2026-04-29T04:19:21.259Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-model-error-with-plackett-luce-loss/MbXFgFrQnmxtxBbHNQvf</loc>
            <lastmod>2025-10-03T00:10:00.972Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-content-strategy-analysis/MjWLlKVzLdCNYFKXUbe8</loc>
            <lastmod>2025-10-08T14:11:51.691Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-optimization/MjijByDUrBL3fhqKsN2J</loc>
            <lastmod>2025-10-03T02:03:18.724Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applicability-of-sequence-level-functions/MoKj2LPUG5I0IVccyJwL</loc>
            <lastmod>2026-06-28T12:18:15.729Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-has-calculated-the-correlation-coefficient-between-several-pairs-of-variables-arrange-t/MpaYboiJRJPSGifSFjH0</loc>
            <lastmod>2025-10-06T22:34:26.276Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ac-loss-function-formulation/Mpx7RW0AyENGYdzFHwsM</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-persistent-general-purpose-behavior-math-fine-tuning/Mr51Sc44Qz5Iot9v8a5A</loc>
            <lastmod>2026-05-01T14:39:58.700Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-building-a-new-large-language-model-from-scratch-they-propose-to-use-a-pre-traini/Mr96oTj6CHlEhbiNKPoS</loc>
            <lastmod>2025-10-01T18:41:59.877Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-using-the-advantage-function-in-policy-gradients/MrcFiOGWvlGGjMeEva4U</loc>
            <lastmod>2025-10-08T22:39:02.793Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-soft-prompt-to-help-a-language-model-generate-a-specific-high-quality-target-se/Ms1bAirIaVv4VSd6N6Uf</loc>
            <lastmod>2025-10-08T21:16:09.690Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-performance-plateau-in-supervised-fine-tuning/MsCS9F6ciykQlPCBlJGD</loc>
            <lastmod>2025-09-26T01:57:17.326Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/surrogate-objective-in-reinforcement-learning/Mt2ztfbTIa87PDPjrhwi</loc>
            <lastmod>2026-07-02T02:49:55.671Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/plackett-luce-loss-formula/MtNRLtj919ruQLdnfYVo</loc>
            <lastmod>2026-05-02T23:29:50.507Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-clinical-inquiry-about-symptoms/MuYueNBHNKXBPE1IoyL8</loc>
            <lastmod>2025-10-05T13:59:52.259Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-selection-in-bon-sampling/MwHhzliPltyhSTaPU1eL</loc>
            <lastmod>2026-05-03T15:33:08.618Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/condition-for-policy-invariance-in-reward-shaping/MwZcqM08fZoVdIPZofUq</loc>
            <lastmod>2026-06-26T13:50:43.956Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-fine-tuning-a-large-powerful-model-to-perform-a-specific-task-instead-of-using-a-dataset-w/MxcpTTGYRt5igwIDOQ6H</loc>
            <lastmod>2025-10-05T20:08:45.664Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-a-conversational-ai-for-memory-constrained-devices/MywkQ6KpuXd3XS2O6fS3</loc>
            <lastmod>2025-10-02T20:29:43.680Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dataset-selection-for-a-specialized-ai-assistant/N1JWmmuzcrJgZRVjQxd0</loc>
            <lastmod>2025-10-05T17:24:49.732Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-in-an-environment-completes-a-sequence-of-two-actions-it-starts-in-an-initial-state-s-perfo/N32gYdbmGl9FqKinEr5H</loc>
            <lastmod>2025-09-26T13:10:59.390Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-data-curation-strategy-for-a-specialized-model/N47ZBovfzp40nRjvJ6w4</loc>
            <lastmod>2025-10-06T11:26:27.682Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-has-a-pre-trained-language-model-and-wants-to-fine-tune-it-to-produce-responses-t/N4wcHTmdck4EXGMZ8abF</loc>
            <lastmod>2025-10-07T08:34:28.369Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-building-a-system-to-generate-automated-email-replies-for-a-small-set-of-common-custo/N8KAUTNY6F7X1kJDP91E</loc>
            <lastmod>2025-09-29T01:21:38.077Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/automating-the-design-and-optimization-of-prompts/N9R8iT02f2bKWG6VOxXD</loc>
            <lastmod>2026-04-30T14:54:00.530Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-instruction-following-summarization/NAvhkffWWRI04llsemWm</loc>
            <lastmod>2025-10-09T02:47:59.579Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/cumulative-future-reward-return/NAxWcOEw3aQ0OLZCjwr6</loc>
            <lastmod>2026-07-03T12:13:10.901Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-fine-tunes-a-large-language-model-using-a-supervised-approach-they-use-a-high/NBahGFMfResjzK9zaOgw</loc>
            <lastmod>2025-10-06T11:14:25.818Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-flawed-summarization-instruction/NCI6yucGABNeUF45LWz8</loc>
            <lastmod>2025-10-10T01:01:47.786Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/challenge-of-articulating-human-preferences-for-data-annotation/NCRNmiyuuactnpky6nzV</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/arrange-the-following-key-developments-in-the-relationship-between-language-models-and-user-interact/NExWTfMh03wKX0unisMl</loc>
            <lastmod>2025-10-06T16:22:38.688Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/high-level-process-of-rlhf-with-ppo/NF8SkIaTRlYrdpYolTJR</loc>
            <lastmod>2025-10-10T04:35:10.010Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/complementary-roles-of-policy-update-constraints/NFiPNjRDo5NFWpQYhouH</loc>
            <lastmod>2025-10-06T15:07:11.142Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-objective-calculation/NFnB6xuyDI9ik5wDw3jQ</loc>
            <lastmod>2025-10-04T04:39:41.762Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-comparing-direct-policy-optimization-dpo-with-proximal-policy-optimization-ppo-what-is-the-prim/NHebUAlmh1CeMF8mVoeR</loc>
            <lastmod>2025-10-05T23:30:49.898Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-trains-a-large-language-model-to-be-helpful-and-harmless-they-create-a-massiv/NJ4cX3F9PoEwO8021Sh8</loc>
            <lastmod>2025-09-26T06:08:45.092Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-a-sequence-evaluation-function/NK7bnSf5lxtMK6hW0a9p</loc>
            <lastmod>2025-10-04T01:40:04.545Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-observes-that-a-large-language-model-pre-trained-on-a-massive-text-corpus-requires-a/NQ4YoL6CaPGFZi10HOSV</loc>
            <lastmod>2025-10-03T19:27:39.042Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-feedback-mechanisms-for-llm-alignment/NQxwL6JlaO9FK6iM2kSg</loc>
            <lastmod>2025-10-03T03:32:50.179Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-ranking-probability/NSiKn4jC90vlbR6Edodx</loc>
            <lastmod>2025-10-08T14:17:04.181Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-core-difficulties-in-model-behavior-guidance/NVC3JWJuYB5pdokSKV2s</loc>
            <lastmod>2026-02-08T13:31:58.515Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-and-correcting-a-fine-tuning-process/NWIoQYPGW5ReAjL8nsR1</loc>
            <lastmod>2025-09-26T03:08:18.367Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-an-instruction-tuned-support-assistant-when-synthetic-data-conflicts-with-human-policy/NZyPVAo0UiRzWgVaFezz</loc>
            <lastmod>2026-02-08T13:57:02.344Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-a-customer-support-translation-system/NcanTaG8Ygvk4v56lfin</loc>
            <lastmod>2025-10-10T01:45:54.573Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-training-a-language-model-on-a-text-corpus-during-training-they-plot-/NcqvtOWKRAeXKMHiqyhY</loc>
            <lastmod>2025-09-28T22:34:14.193Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-function-equivalence/NgBT0voPayMntahvkCG2</loc>
            <lastmod>2025-10-04T01:41:44.486Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-example-of-an-instruction-response-pair-to-the-type-of-instruction-following-task-it-repr/Nkg5snV8WBkyYizkDtml</loc>
            <lastmod>2025-10-02T03:49:35.697Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applicability-of-supervised-fine-tuning/NoSC9Wu57o64MeyOci86</loc>
            <lastmod>2026-04-30T23:15:51.021Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/decomposing-a-ranked-list-into-pairwise-preferences/NpXHeoKGVIZgp7bftmMU</loc>
            <lastmod>2025-10-02T09:21:41.184Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-reward-model-failure/NqjtfVewAhbOl7V15uSc</loc>
            <lastmod>2025-10-10T03:43:28.099Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-training-a-reward-model-the-parameter-set-which-is-optimized-to-minimize-the-loss-/NrZkeA6MqIHChA2s1imo</loc>
            <lastmod>2025-10-07T12:08:20.559Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-inference-engine-using-a-continuous-batching-scheduler-is-operating-at-maximum-capacity-meaning-i/NsARL6UYCPiGlvJdDkjJ</loc>
            <lastmod>2026-04-26T18:31:40.148Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-llms-for-prompt-simplification/NsLfQ4wQZW34uop9HEWR</loc>
            <lastmod>2026-04-30T22:48:26.683Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-is-training-a-model-to-generate-creative-stories-they-implement-a-reward-mec/NtuWbKZd21JI4zgiH9HY</loc>
            <lastmod>2025-10-02T04:01:42.669Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-is-using-the-following-formula-to-find-the-best-soft-prompt-for-a-large-language-model-/NuI2MM7UeYsQZhms2aS7</loc>
            <lastmod>2025-10-03T20:58:21.484Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applicability-of-context-compression-to-general-text-compression/Nuvro7mn28NqzkicwlIg</loc>
            <lastmod>2026-04-30T22:35:44.514Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/input-for-next-token-prediction/NxB4ZVpd1w8LhqFVe4Vi</loc>
            <lastmod>2026-06-30T00:53:26.406Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-dpo-preference-probabilities-and-pipeline-implications-from-logged-policy-ratios/NzlR50hWuVI9LHNQzx3x</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/decomposition-of-reward-sum-for-causality-in-policy-gradients/NzxgQQGoAetVO66UWCqk</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-objectives-supervised-fine-tuning-vs-rlhf/O10eVbRICzbTFs8Rz4tw</loc>
            <lastmod>2026-05-01T15:48:55.371Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-chatbot-response-quality/O30jJnN0NExD2zjRMfDu</loc>
            <lastmod>2025-10-03T21:32:55.377Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-using-a-large-language-model-to-automate-the-quality-rating-of-a-narrative-the-model-gener/O49mPaaL9JBHKlaXe6yN</loc>
            <lastmod>2025-10-04T16:08:57.126Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-on-a-dataset-of-human-preferences-where-each-data-point-consists-of-/O4lcyDa9A8ZgWO3NhTIQ</loc>
            <lastmod>2025-10-10T05:47:45.988Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-evolutionary-algorithms-for-diverse-instruction-generation/O5W21ArwYTJc4jm0FNHp</loc>
            <lastmod>2026-05-01T10:20:15.722Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-data-scientist-is-building-a-model-to-predict-whether-an-email-is-spam-the-model-uses-the-emails-s/O5en7IfNpZIKqv3dxlsi</loc>
            <lastmod>2026-04-29T04:19:13.051Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/strategies-to-enhance-output-diversity-for-reranking/O6Koqpl6T4bBA3jyXwrE</loc>
            <lastmod>2026-05-03T15:35:26.323Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/baselines-role-in-centering-rewards-and-reducing-gradient-variance/O71Z38NwyXFYcuIbywLh</loc>
            <lastmod>2025-10-06T17:31:42.475Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-using-an-algorithm-where-the-value-networks-performance-is-measured-by-the/OBTHXpA9M3FlThpDPV2B</loc>
            <lastmod>2025-10-03T21:11:01.670Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-global-ai-moderation-strategy/OCEfhiOiBSlj2no3ewbK</loc>
            <lastmod>2025-10-01T21:57:34.975Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-evolution-of-prompting-into-a-research-discipline/OEBQD19rPvTCwBnUBlKH</loc>
            <lastmod>2025-10-06T02:03:32.867Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-using-a-policy-gradient-method-a-batch-of-data-d-is-collected-containing-e/OFybzrXByt0g2G5ay2pw</loc>
            <lastmod>2025-10-08T23:11:30.195Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-using-a-policy-gradient-method-after-each-update-to-its-decision-making-pr/OHMFCu3ziwBD0MVbaAY5</loc>
            <lastmod>2026-06-17T21:33:04.789Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/youre-reviewing-an-internal-design-doc-for-adapti/OItoi4hAbcu4qEYQt6Ik</loc>
            <lastmod>2026-02-06T18:03:17.772Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-soft-prompt-optimization-by-minimizing-kl-divergence/OJgfgO3hv5aryqj18BPA</loc>
            <lastmod>2026-07-03T23:21:45.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-probability-ratio-ratio-function/OKOtBS0hLRKHcuCKTk1s</loc>
            <lastmod>2026-06-28T20:44:33.624Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-optimizing-soft-prompts-via-context-compression/OMnuwg9XlNL5tcfC5Nr4</loc>
            <lastmod>2026-07-03T23:21:45.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-and-fixing-a-synthetic-instruction-tuning-data-flywheel-that-degrades-model-behavior/ON7uEG3VRfOBoL2Qw9vr</loc>
            <lastmod>2026-02-08T13:57:01.915Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/architectural-prioritization-for-a-long-context-llm/OO5fTN1HKvaX04iNgObU</loc>
            <lastmod>2025-10-01T19:13:24.896Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/establishing-a-performance-benchmark/OOPnPFwdueAEfPQ4slEG</loc>
            <lastmod>2025-10-03T06:26:06.390Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-training-a-policy-model-for-a-chatbot-using-a-combined-reward-signal-this-/OP7v2UAF9U3XojBDqoX3</loc>
            <lastmod>2025-10-05T19:23:47.453Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-using-a-rule-based-method-to-automatically-shorten-a-users-text-input-the-goal-is-to-/OQvTZKKykHaE6onpmdbo</loc>
            <lastmod>2025-10-05T12:21:04.992Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/model-adaptation-strategy-for-a-resource-constrained-startup/OSkwT1gtbSxVUb0rUFLD</loc>
            <lastmod>2025-09-29T00:12:24.730Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-potential-fine-tuning-dataset/OTOfCUFlPH99aayimfoC</loc>
            <lastmod>2025-10-03T16:55:30.572Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-working-to-improve-a-large-language-models-behavior-they-create-two-distinct-d/OTq9zoYMxZsXTemTTt3Z</loc>
            <lastmod>2026-02-08T13:18:51.651Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-reinforcement-learning-phase-of-model-alignment-the-reward-models-primary-function-is-to-/OUbaMmxWRCX3kEwgCGVh</loc>
            <lastmod>2025-10-02T08:28:55.861Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-a-fine-tuning-step-for-a-large-language-model-using-an-advantage-actor-critic-ac-approach-the/OVxpdKHYmnAF5dpu10E7</loc>
            <lastmod>2025-10-10T10:31:33.966Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/conditions-for-zero-hinge-loss-in-a-reward-model/OXPG1XuhYV2GNIA2sxRC</loc>
            <lastmod>2025-10-08T21:59:19.917Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/chatbot-performance-degradation/OXaNc8Q3GhsPuYVouo1Q</loc>
            <lastmod>2025-09-29T12:13:41.073Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-competing-ai-responses/OY2O7dYlPWUk3OS50Lia</loc>
            <lastmod>2025-09-26T02:23:28.264Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-model-parameter-updates/OYeXF4BqpX34TyUuV21J</loc>
            <lastmod>2025-10-05T21:59:36.776Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dual-benefits-of-detailed-supervision-in-llm-reasoning/Ob21JRaGOOVQyK1t1IEW</loc>
            <lastmod>2026-05-03T15:25:53.188Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/squared-sum-of-rewards-regularization/Oe55GeZGxfMCUXyNyKFF</loc>
            <lastmod>2026-05-02T23:47:49.388Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-policy-update-mechanisms-in-reinforcement-learning/OeOL9toiOaNu9uf0qMBI</loc>
            <lastmod>2025-10-06T14:07:02.603Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-preparing-a-dataset-to-train-a-language-model-to-summarize-articles-b/OgVlyfYh7tp41CFcuI2C</loc>
            <lastmod>2026-02-08T14:02:07.479Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/post-deployment-peft-choice-and-prefix-input-composition-for-a-multi-tenant-llm-service/OhPko7JrooeLdlhvk3HE</loc>
            <lastmod>2026-02-06T18:01:46.163Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-technology-company-claims-it-can-create-a-perfectly-helpful-and-harmless-ai-assistant-by-simply-pr/OhSEv69s06GzzBk3pOC5</loc>
            <lastmod>2025-10-01T19:32:27.736Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/perfect-negative-correlation/OioV5QmKAqX8IuWO3b5Y</loc>
            <lastmod>2026-05-02T09:10:54.925Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/variance-in-surrogate-objective-gradient-estimates/OjovN9veRxBqjStKLqeX</loc>
            <lastmod>2026-05-01T18:36:55.748Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-with-baseline/OkOvdfUPkLOQugORJary</loc>
            <lastmod>2026-06-17T21:49:32.455Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-in-a-given-state-s-takes-an-action-a-the-sequence-of-rewards-it-receives-from-that-point/OkUaNhmavwMlkAevrafI</loc>
            <lastmod>2025-10-07T09:14:35.418Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-reward-model-robustness/Okph0XWaN0CYc10M9Phi</loc>
            <lastmod>2025-10-01T20:45:35.843Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-an-automated-process-for-generating-training-data-a-language-model-has-just-created-a-new-unique-/Ol9hHMYikC52v3G7aZkT</loc>
            <lastmod>2025-10-02T04:40:57.919Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-data-scientist-is-studying-the-relationships-between-different-variables-they-calculate-the-follow/OlTthiwfPs6Jn5MmVVoR</loc>
            <lastmod>2025-09-29T12:12:40.128Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-gradient-method-an-agent-executes-a-specific-trajectory-the-score-function-defined-as-th/OlZg4VJrFa8dDT3z8DwI</loc>
            <lastmod>2025-09-26T04:30:13.514Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluation-outcome-preference-for-empathetic-response/OnbyUbgBoxEcVvym375t</loc>
            <lastmod>2026-05-03T01:05:47.151Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-unexpected-model-behavior/Oomty20eFC6Hr8W7clPc</loc>
            <lastmod>2025-10-02T08:54:17.194Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-prediction-with-full-context/OpghpuNwSRk4xXsDPSVX</loc>
            <lastmod>2026-06-29T12:21:09.064Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/robot-navigation-path-selection/OtDqHCmidISSeq267Nlx</loc>
            <lastmod>2025-10-03T19:48:15.652Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/notation-for-ground-truth-labels-in-segment-classification/Ow47NVrxTpSkBgymcfln</loc>
            <lastmod>2026-06-21T01:49:11.029Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/worth-function-in-plackett-luce-model/OxOUW4kEuC59iJREbqU6</loc>
            <lastmod>2026-06-29T22:00:13.890Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-single-data-point-x-ya-yb-from-a-preference-dataset-where-ya-is-the-preferred-response-an/OxW9ugl4MNMkuJnI3a0V</loc>
            <lastmod>2026-05-03T00:58:01.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-creating-a-soft-prompt-to-summarize-a-complex-user-manual-for-a-question-answering-model-t/P37gL2PbNxYHzkuYIfc7</loc>
            <lastmod>2025-09-28T16:28:14.041Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/bradley-terry-model/P6kh4AgviJ7FWAZN7jmL</loc>
            <lastmod>2026-05-01T17:14:35.444Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/value-loss-calculation-for-a-single-sequence/P75FysWawo6HzAgRPrem</loc>
            <lastmod>2025-10-10T01:21:55.976Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/constructing-an-sft-training-pair-for-text-summarization/PC1ub39m4rEr7A3Ddf3k</loc>
            <lastmod>2025-10-06T03:22:36.297Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-probability-distribution-notation-prthetascdot/PEp37oUg4Z4imgDfPrAL</loc>
            <lastmod>2026-06-26T20:30:27.190Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-economic-efficiency-of-model-adaptation/PHEIcIWqDlGy4ZNLOGSm</loc>
            <lastmod>2026-02-08T14:08:49.535Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/direct-preference-optimization-dpo/PKkyE7RhJU5z5U3jf06v</loc>
            <lastmod>2026-06-26T22:34:07.108Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-optimization-step-for-a-language-model-the-advantage-for-a-particular-generated-token-is/PKqsq7EqHJrERVTMntop</loc>
            <lastmod>2025-09-26T07:10:29.285Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-in-a-state-s-and-follows-a-fixed-policy-from-this-state-the-environment-is-stochastic-th/PLMjFhV12OfHtOf4REKz</loc>
            <lastmod>2025-10-08T14:38:25.581Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/incorporating-policy-divergence-penalty-into-the-clipped-surrogate-objective/PLaRpunG8hpnIwppV1IK</loc>
            <lastmod>2025-10-06T21:09:02.443Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-policy-optimization-an-objective-function-is-often-constructed-using-data-from-a-fixed-older-poli/PNlb6AbTiHgbvLUXkV6j</loc>
            <lastmod>2025-10-08T23:07:59.704Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-scheduling-an-after-hours-medical-appointment/POuzt8vaDWXKPSOvIX1f</loc>
            <lastmod>2025-10-05T13:40:15.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-concatenated-mathbfx-mathbfy-sample-for-machine-translation-fine-tuning/PPWrYEquSfqSyQW786zB</loc>
            <lastmod>2026-05-01T00:56:27.293Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dataset-selection-for-model-specialization/PUszfaFrpzNrgqsLSJMr</loc>
            <lastmod>2025-09-28T14:59:22.174Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/potential-based-shaping-function-formula/PWvsfZvIfKFNQ8gD4RNS</loc>
            <lastmod>2026-05-02T23:56:25.481Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-trained-using-a-policy-gradient-method-where-the-policy-is-updated-based-on-the-total-re/PYaeI6k6kwWaeJ3x8zRy</loc>
            <lastmod>2025-09-26T13:13:27.787Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-function-in-terms-of-policy-models-and-normalization-factor/PYnCxppZdzUCFQqU47bk</loc>
            <lastmod>2026-05-03T00:50:56.739Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-data-sourcing-strategies/Pab1aI7ncvrcpK5EgV5n</loc>
            <lastmod>2025-10-02T10:17:01.129Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-is-being-updated-the-current-policy-is-denoted-by-pitheta-and-a-batch/PagA3ZWVJ2LKa6Q1Z1ki</loc>
            <lastmod>2025-10-03T16:33:53.913Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-scaling-factor-on-normalization/Pb3JwYQB3Pj7Wzg54u9O</loc>
            <lastmod>2025-10-08T22:45:39.527Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-fine-tuning-a-large-language-model-using-a-combined-loss-objective-which-includes/Pcmt5YUiAqZo7Kkb55Ne</loc>
            <lastmod>2025-10-10T09:55:51.410Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/preference-models-as-a-sequential-step-for-generalization/Pg5flEEbWwlKTtNWOOr9</loc>
            <lastmod>2026-05-01T11:02:57.246Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-policy-update-instability/PgEonNIx3SvMHfxXcjS1</loc>
            <lastmod>2025-10-03T21:44:23.824Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/significance-of-the-evolving-definition-of-alignment/PgXiD4Ej3a9XmnAQqLw2</loc>
            <lastmod>2025-10-06T18:51:39.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formulating-conditional-probability-in-dialogue/PgeqDAe4rR5odnukXuo0</loc>
            <lastmod>2025-10-04T01:55:28.086Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/pointwise-method-rating-for-human-feedback-in-rlhf/PlJ2T8fElfS0cPjYYB0y</loc>
            <lastmod>2026-05-01T17:13:56.789Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/general-loss-minimization-objective-for-reward-model-training/Po8JnouSu2n7WwTStNDw</loc>
            <lastmod>2025-10-06T15:20:00.036Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-a-reward-models-architecture/PoUHAhZTuxTToDCFMDO7</loc>
            <lastmod>2025-09-26T14:43:46.310Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/customer-support-chatbot-performance/PpIDF5OROMWM0CTB3nzT</loc>
            <lastmod>2025-10-07T09:40:08.321Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-a-reward-function-to-a-language-models-output/PrFA6IlkdcK92qATOvze</loc>
            <lastmod>2025-10-04T03:17:35.373Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-segmentation-strategies/PtEf6W4QnouzCPOA3XMc</loc>
            <lastmod>2025-10-06T22:54:55.406Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-building-a-customer-service-chatbot-for-a-financial-institution-using-a-state-/PvYgdIYgKloQ4nVrEhlQ</loc>
            <lastmod>2026-04-29T04:19:15.093Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/unifying-principle-in-model-guidance/PvhuODIX570VSeVPFcDE</loc>
            <lastmod>2025-10-02T10:04:30.006Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/incident-triage-long-running-agent-workflow-with-windowed-vs-compressive-memory/PwAFyYM9Br2MZrv9epyg</loc>
            <lastmod>2026-02-06T18:31:35.662Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/aspect-based-sentiment-analysis-as-an-example-of-granular-evaluation/PwlwL6n6MNRhFKrsSC3g</loc>
            <lastmod>2025-10-09T03:05:12.095Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/computational-efficiency-of-fine-tuning-compared-to-pre-training/PwnRbPKvEvL5fmkTptYQ</loc>
            <lastmod>2026-05-03T15:43:08.627Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-adapting-a-large-pre-trained-language-model-for-a-specialized-legal-docume/PzAwstGh3xngLE1qhbdO</loc>
            <lastmod>2025-09-26T09:18:53.962Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/function-of-a-sequence-of-overlined-variables/Pzvt5rfn3pjOuIeTQmwf</loc>
            <lastmod>2026-07-03T00:57:01.134Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-given-the-initial-text-the-sun-is-shining-and-the-sky-is-the-model-then-generate/Q4QN5egDHysR2Djbvcih</loc>
            <lastmod>2025-09-26T11:47:23.149Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/mathematical-formulation-of-the-supervised-fine-tuning-objective/Q6a4ew1UBqGeYqEIt0hT</loc>
            <lastmod>2026-04-30T23:50:26.122Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/alternative-ranking-methods-ranknet-and-listnet/Q7EMT59ffr0xQ0VZlRXS</loc>
            <lastmod>2026-05-02T23:31:24.625Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-efficient-instruction-following-techniques/Q7EjCxcKOdBdtn9rb4dr</loc>
            <lastmod>2025-10-05T22:44:14.584Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/adapting-ai-input-optimization-for-data-storage/Q857noIkniXtErhXeFM3</loc>
            <lastmod>2025-10-05T12:24:49.479Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-of-ai-developers-is-building-a-new-large-language-model-from-scratch-aiming-for-it-to-be-both/Q9XhbMh7ilFRO0xkgcJC</loc>
            <lastmod>2026-04-30T23:33:48.347Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-model-adaptation-trade-offs/QAHkufawnCWKBHj2ylMY</loc>
            <lastmod>2025-10-06T21:13:50.494Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-prompt-template-for-instruction-generation/QBDOYIGSTE3tUmGC2guB</loc>
            <lastmod>2025-10-05T18:10:28.016Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-sparse-reward-strategy/QBzEJh62wyTvte4ROp42</loc>
            <lastmod>2025-10-06T21:46:31.368Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-aims-to-deploy-a-sophisticated-language-model-on-mobile-phones-but-their-current-state-of-/QCeehc4gwgn0wSpLD4Aa</loc>
            <lastmod>2025-10-05T23:17:50.214Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/definition-of-sft-datasets/QD6yFDKPuSuA3YHQ6aFw</loc>
            <lastmod>2026-04-30T23:39:36.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-transformation-formula/QEPW1BgEyeTr9cEamgMn</loc>
            <lastmod>2026-06-23T23:14:53.287Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-using-a-listwise-ranking-approach-to-collect-human-feedback-for-a-language-model-the-primary-ta/QJ13BLWgDQARfgvKlkHy</loc>
            <lastmod>2025-10-10T06:15:55.852Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fine-tuning-for-a-niche-domain/QJ8FNYTPP0KjwcoUzjsb</loc>
            <lastmod>2025-10-02T19:50:57.896Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-calculation-of-a-normalization-factor-using-the-formula-zmathbfx-summathbfy-pithetatext/QJqmK7YTPfSdLkbqApmR</loc>
            <lastmod>2025-10-04T03:47:46.875Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-conditional-probability-notation-in-text-summarization/QPQMkhL8NrEuIkvNnezB</loc>
            <lastmod>2025-10-08T16:03:25.426Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-models-human-preference-between-two-generated-responses-a-and-b-for-a-given-prompt-it-does-/QPj2qPxymg0hpx6n2sKD</loc>
            <lastmod>2025-10-06T19:08:19.690Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-action-advantage/QQUGiQAvX0gb5DoNJRVq</loc>
            <lastmod>2025-10-08T12:39:59.769Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-aims-to-adapt-a-general-purpose-language-model-to-function-as-a-specialized-helpf/QSjDFL0B3fhzbNZjIo8w</loc>
            <lastmod>2025-10-02T19:36:55.173Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-fine-tuned-using-feedback-is-in-the-middle-of-generating-a-response-for-a-single-sp/QX4bFEZ6eZkTElyGweWu</loc>
            <lastmod>2025-10-06T11:23:14.189Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-preference-modeling-strategies/QXHxwCwi9s6Tp6V15SSw</loc>
            <lastmod>2025-10-01T19:22:47.385Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-estimating-the-advantage-of-taking-an-action-at-in-a-state-st-the-formula-ast-at/QXzceDX2dgq2prkm4aMf</loc>
            <lastmod>2025-10-04T03:52:53.193Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-divergence-penalty-for-language-models/QYhnQgzTXNkdA9Jc5X00</loc>
            <lastmod>2026-07-03T01:17:10.786Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-instability-in-an-rlhf-ppo-training-run/QZnwb2NjKVn4HIv5WuCL</loc>
            <lastmod>2026-02-06T16:56:58.916Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-of-the-denoising-objective/QbCBDipYLerBW4hLYNLB</loc>
            <lastmod>2026-04-29T03:51:54.528Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-loss-function-for-model-distillation/QcjimMOffeCNtNFE6dB4</loc>
            <lastmod>2025-10-08T12:28:10.427Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analogy-to-nlp-data-augmentation-in-synthetic-data-generation/QfBu4dvFCwM6oe2Oyxu3</loc>
            <lastmod>2026-05-01T01:12:49.109Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/surrogate-objective-at-the-policy-reference-point/Qgc9rGQFnghJVnofCJ0U</loc>
            <lastmod>2026-06-29T12:34:56.503Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-fine-tuning-a-language-model-for-a-specialized-task-the-most-effective-strategy-is-always-to-ma/QhwsKYREfyVAHU61Gz9P</loc>
            <lastmod>2026-02-08T14:24:45.658Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-models-prediction-rule-is-to-select-the-output-with-the-highest-conditional-probability-g/Qnv7t7ORWpXOJux7M2AD</loc>
            <lastmod>2025-10-03T22:04:09.186Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-self-driving-car-is-being-trained-to-navigate-a-city-analyze-the-components-of-this-system-and-mat/Qp0XDe6tRyfUPIJsS1tv</loc>
            <lastmod>2025-10-10T09:54:20.530Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/model-performance-evaluation-using-plackett-luce-loss/Qpdc84Y2MwSZDtYuu6rE</loc>
            <lastmod>2025-10-08T16:45:25.502Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/notation-for-a-function-applied-to-a-sequence-of-average-vectors-sbarmathbfy-dots-barmathbfyk/QtCD0O1UdEFtDI8mXauR</loc>
            <lastmod>2026-06-30T07:51:35.853Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-behavior-analysis/QuKZy4a1I3tprrOshxtr</loc>
            <lastmod>2025-10-07T09:30:23.219Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/measuring-weak-to-strong-generalization/QuSLuSj27ujlUEEE1Fz1</loc>
            <lastmod>2025-10-03T06:14:53.112Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/state-value-and-action-value-functions/Qz3tI4JjZ32q6BVlSPAm</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-building-several-different-reward-models-each-with-a-unique-primary-objective-for/R0V7j7v7Y3OmTiBMYABK</loc>
            <lastmod>2025-10-02T21:47:25.286Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-asks-a-large-language-model-for-a-simple-healthy-recipe-for-a-quick-lunch-the-model-provides-/R57XalJMcCXZ4GFQlYXx</loc>
            <lastmod>2025-10-03T18:27:45.069Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/characteristics-of-sft-datasets/R6O5yxhEbcfTOqW2dPpz</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-trained-on-a-dataset-d-by-finding-the-parameters-hattheta-that-optimize-the-foll/R8Cfe9k8fiky9l2klOxL</loc>
            <lastmod>2026-04-29T04:19:20.437Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-model-is-being-trained-to-classify-text-segments-as-either-helpful-or-unhelpful-during-one-trainin/RBz7eNejrhCuVa47DWl9</loc>
            <lastmod>2025-09-26T09:47:34.852Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-learning-issues-in-policy-gradients/RCv2GBflGWXNRJWwtQzI</loc>
            <lastmod>2025-10-02T10:57:33.736Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reference-policy-and-model-probability/RD0hC8Cha8wrv716Hc1k</loc>
            <lastmod>2025-10-08T15:00:17.694Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-a-prompting-strategy-for-a-new-ai-application/RG9MebBMpPkDlTvuFL2L</loc>
            <lastmod>2025-09-28T17:18:12.244Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-training-objective-for-a-base-model/RGjCLOr3KxqouktSm0qh</loc>
            <lastmod>2025-10-03T02:11:22.113Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-value-model-is-being-trained-to-estimate-the-expected-future-reward-from-a-given-state-its-loss-is/RHPTQ7q7kle6ASUkz2Qq</loc>
            <lastmod>2025-10-08T15:20:57.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-new-automated-vacuum-cleaner-is-programmed-to-learn-the-most-efficient-path-to-clean-a-room-it-use/RI17BU2JjgAPedwyHGTl</loc>
            <lastmod>2025-09-26T01:55:08.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/explaining-the-impact-of-targeted-training/RIAZfrxSgj7OInzpU9UR</loc>
            <lastmod>2025-10-06T23:45:23.547Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-hacking-homework-analogy/RJyDEgJahFb0tPSl17Cg</loc>
            <lastmod>2025-10-09T03:13:49.770Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/kullback-leibler-divergence/RNGKT2otf0186Rz9HFQi</loc>
            <lastmod>2026-07-04T02:45:32.351Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-preparing-a-dataset-to-fine-tune-a-large-language-model-for-a-customer-service-chatbot-the/RNN0eyPrHmgb0iZzdzVQ</loc>
            <lastmod>2025-09-28T19:45:16.317Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/feasibility-of-a-perfect-reward-model-for-self-driving-cars/ROFNF8cyRNjWL5j95e3W</loc>
            <lastmod>2025-09-26T05:51:27.788Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/strategic-analysis-of-an-energy-firms-financials/ROFPpqujGcVg82HiVmjl</loc>
            <lastmod>2025-10-10T05:40:48.618Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/difficulty-of-obtaining-segment-level-human-preference-data/RPyoSm6Nf89wMEiaxjKA</loc>
            <lastmod>2025-10-06T23:48:52.745Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/creating-a-specialized-llm-for-medical-summarization/RQUdFXeglx0oFpUcBFIC</loc>
            <lastmod>2025-10-02T06:19:35.397Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-segmentation-strategy-suitability/RTRbMeXwlX91se0S79sq</loc>
            <lastmod>2025-10-02T08:03:36.992Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-a-language-model-is-fine-tuned-using-a-system-that-incorporates-human-preferences-this-process-/RUOp2gIw1CHCOyITIoag</loc>
            <lastmod>2025-10-03T19:04:52.787Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/true-or-false-in-a-reinforcement-learning-from-human-feedback-rlhf-system-the-reference-policy-pithe/RUQcv5OgvQNSqtBAmOfn</loc>
            <lastmod>2025-10-03T20:37:50.478Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-model-to-automatically-simplify-complex-legal-documents-into-plain-l/RUy97l5PkIrBlLQH58V7</loc>
            <lastmod>2025-10-02T20:42:48.874Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-a-fine-tuning-data-pipeline/RVX4q4PTbr9DHkKmssFL</loc>
            <lastmod>2025-10-01T20:49:07.929Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-a-prompting-strategy/RW0gxBlQYilZzAvm0LE2</loc>
            <lastmod>2026-04-29T04:14:33.722Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-reward-model-for-a-language-model-they-collect-human-feedback-by-presenting-ann/RZ3FzGC8tEPFfAc0Rv25</loc>
            <lastmod>2025-10-05T19:49:06.101Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-using-the-advantage-function/RZC5J0kzK2FGrF67Z7cT</loc>
            <lastmod>2025-10-07T00:29:17.427Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prompting-strategy-for-a-customer-service-chatbot/RbQq7cebRfAlQZgf7Aiz</loc>
            <lastmod>2025-10-03T01:59:43.561Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-tasked-with-aligning-a-new-chatbot-to-be-helpful-and-harmless-instead-of-build/Rcntgnt7kCpaOiYvQ3pz</loc>
            <lastmod>2025-10-03T03:49:35.575Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/role-of-regularization-in-mitigating-reward-model-underdetermination/RfLlTQ01oo3A3nbWgYIS</loc>
            <lastmod>2026-05-02T23:50:11.275Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/mechanism-of-direct-policy-optimization/RhCTdYpihmFVO4kgKxp9</loc>
            <lastmod>2026-06-26T22:34:00.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-using-an-automated-process-to-generate-new-training-data-the-process-involves-sho/RmszY5xqU1wwCP3YdlWQ</loc>
            <lastmod>2025-10-05T17:12:57.696Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/importance-of-step-by-step-supervision-for-complex-reasoning/RmxhwfwejBm5Qst0982w</loc>
            <lastmod>2026-05-03T15:24:15.371Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-beginning-a-project-to-fine-tune-a-language-model-for-a-new-task-translating-technical-man/RoDt0kMU6DAMtaGpz8YO</loc>
            <lastmod>2025-09-28T15:58:45.633Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/validating-a-potential-based-shaping-function/RrB77DnkVjihvCilwFpL</loc>
            <lastmod>2025-10-08T20:10:21.325Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/challenges-in-defining-human-preferences-for-llm-alignment/Ruw4wHbTvS7AQ4ZaTrpy</loc>
            <lastmod>2026-04-20T00:15:41.195Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-student-model-is-being-trained-using-a-combined-objective-that-incorporates-learning-from-both-a-l/RvG7RKFsS3MBCgPFdp5o</loc>
            <lastmod>2025-10-06T12:25:07.878Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/objective-function-for-policy-learning-in-rlhf/RvO4rqNYQmEaHVyjlTg7</loc>
            <lastmod>2026-06-21T02:09:16.184Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/notation-for-machine-translation-probability/RywAHB4sNYkZYt29lKbW</loc>
            <lastmod>2025-10-03T21:36:27.824Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-using-the-formula-scorey-yx-exprx-y-to-adjust-the-likelihood-of-a-potential-output-y-setting-th/RzjexTXgICUlvTGitm8a</loc>
            <lastmod>2025-10-07T09:36:14.595Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluate-the-following-statement-the-objective-of-supervised-fine-tuning-is-to-discover-an-entirely-/S2ijZ94bjbGMUi4NiIhX</loc>
            <lastmod>2025-10-08T22:10:56.672Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/explaining-unexpected-model-capabilities/S3EQHcqP9cHSTEktnV67</loc>
            <lastmod>2025-10-05T17:28:48.068Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/derivation-of-reward-decomposition-in-policy-gradient-with-baseline/S4NM9mUZkscOjLgFDWSt</loc>
            <lastmod>2026-06-25T21:52:29.667Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-the-weak-to-strong-fine-tuning-objective/S5BvrPjujamoE1T8kfaC</loc>
            <lastmod>2025-10-08T22:30:38.597Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-ppos-stabilization-components/S6ZI6mGlxIbQSxKzAKsQ</loc>
            <lastmod>2025-10-02T09:16:33.422Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ensemble-of-five-models-provides-predictions-for-a-binary-classification-task-class-a-or-class-b-/SAgWEQu6LD5id6HYx3AS</loc>
            <lastmod>2025-10-06T00:04:29.090Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-fine-tuning-data-diversity-on-llm-generalization/SB9J9RQHpGRhqymUBmE1</loc>
            <lastmod>2026-05-01T14:39:23.014Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-advantage-from-a-trajectory/SFTZgbiDen9B90HCbbuC</loc>
            <lastmod>2025-09-29T01:52:07.289Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/creating-a-task-sample-for-a-language-model/SHBS4TAC6FLTEgCrpP2l</loc>
            <lastmod>2025-10-07T15:14:17.179Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/challenges-in-llm-alignment/SI9GGTFZa5ZYkljTxwaq</loc>
            <lastmod>2026-04-30T23:28:25.997Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-a-feedback-collection-method/SK94064qQZ0aOoYMPo0c</loc>
            <lastmod>2025-10-08T13:13:03.325Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-prompting-method-for-business-applications/SO9ek5n4hCVVCsFgJQbA</loc>
            <lastmod>2025-10-05T23:06:50.621Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/equivalence-of-language-model-and-policy/SQaNILIQAWtoakRaXZoR</loc>
            <lastmod>2025-10-03T16:22:35.385Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-meteorologist-is-building-a-model-to-forecast-the-probability-of-rain-tomorrow-the-model-considers/SRJvyD8mJszVxuCTPVHA</loc>
            <lastmod>2026-04-29T04:19:17.201Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-language-model-generation-strategies/SS2LMx0mYocfJT5CZROh</loc>
            <lastmod>2025-10-03T05:42:08.679Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-using-a-knowledge-distillation-framework-to-create-a-compact-efficient-languag/SWaHOuYkcNeEOQZ1xTW6</loc>
            <lastmod>2026-06-28T21:47:22.888Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/token-level-loss-calculation-in-a-backward-pass/SXWDSiw8NnYW0808rKt4</loc>
            <lastmod>2026-05-01T06:04:57.393Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-sft-dataset-samples/SZx0Fjf5unkNzeyHkBqe</loc>
            <lastmod>2025-10-09T03:19:31.309Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-reward-model-strategy-for-a-new-chatbot/ScStIQ6zZXHpfI20DYdc</loc>
            <lastmod>2025-10-01T20:38:18.875Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-spam-classification-prompt/ScUnliwLZka7moOiD7Jg</loc>
            <lastmod>2025-10-09T03:20:15.413Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineering-team-is-developing-a-compact-fast-model-to-replicate-the-predictions-of-a-much-larger/SeYQqXLcJUKIspFAI8Tq</loc>
            <lastmod>2025-10-01T20:23:49.990Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-tasked-with-generating-a-sentence-after-producing-the-partial-sequence-the-cat-s/Shx2QVgUkTMZJnQuXuSB</loc>
            <lastmod>2025-09-26T12:14:00.769Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-at-time-step-t-it-must-choose-between-two-actions-action-a-and-action-b-if-it/Sja7dq0RkjvJQIsnDuRw</loc>
            <lastmod>2025-10-03T22:07:34.577Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-prompt-engineering-workflow/SlOdNcf50pxxDJmR6TYy</loc>
            <lastmod>2025-09-28T22:19:11.362Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rescoring-and-reranking-for-inference-time-alignment/SmZ6yBLUrH4GKu8kP4Sp</loc>
            <lastmod>2026-05-03T15:33:35.215Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-two-reinforcement-learning-agents-agent-a-and-agent-b-on-the-same-task-using/SoYTiZN5fp3BE863UDBX</loc>
            <lastmod>2025-09-29T01:22:20.535Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/distinguishing-system-components-in-a-learning-scenario/Sots4bSVdh1wag03pxbM</loc>
            <lastmod>2025-10-06T01:01:54.024Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/classification-of-llm-fine-tuning-approaches-for-reasoning-tasks/SrhcmuCvyNpHwWG0cIuf</loc>
            <lastmod>2026-05-03T01:25:03.408Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-human-reviewer-has-provided-feedback-on-three-different-ai-generated-summaries-of-a-document-order/SsQnNxfvlqcDzxjBTzkL</loc>
            <lastmod>2025-09-28T23:39:37.311Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/conditional-log-probability-of-a-response-in-multi-round-dialogue/Sy1jRh8VN9yOxDHcfksA</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consequences-of-omitting-a-reference-policy-in-rlhf/SzYsBNLIqWMYxu94wZyU</loc>
            <lastmod>2025-10-07T11:40:24.412Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-policy-updates-in-a-game-playing-ai/T0sNKZzTH0q1UB0e85a8</loc>
            <lastmod>2025-10-04T05:29:24.372Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-company-is-training-a-language-model-to-be-a-helpful-and-harmless-assistant-when-the-model-gen/T1ODQgj7Y2kimqpwfDOP</loc>
            <lastmod>2025-09-26T11:12:53.396Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-model-reasoning-processes/T1QHcOUYqYylsgWFvg2k</loc>
            <lastmod>2025-10-06T21:04:52.174Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-text-generating-model-is-given-the-input-sequence-of-tokens-the-quick-brown-fox-it-then-generates-/T2hQU2dPhWk8cjZqRoxe</loc>
            <lastmod>2025-10-04T05:49:02.674Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-building-a-dataset-to-improve-a-language-models-ability-to-answer-questions-about-a-new-so/T34AdmzHgTPd9sag731p</loc>
            <lastmod>2025-10-05T21:12:37.105Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-neural-network-to-evaluate-the-quality-of-different-text-outputs-generated-in-r/T3DqcNsiUmtShPFgKaBq</loc>
            <lastmod>2025-09-28T12:00:45.666Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-assigns-a-worth-value-to-potential-text-completions-calculated-as-the-exponential-of-a-rewa/T4QGICSa4KKxyZgwXcwG</loc>
            <lastmod>2025-09-28T11:27:52.491Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-language-model-training-objectives/T4rQ8sjRymgqKykbS5KA</loc>
            <lastmod>2025-10-05T23:41:37.903Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-model-training-performance/T5FENSPRzcYnWZQO7mAK</loc>
            <lastmod>2025-10-08T16:22:06.497Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-mathematical-expression-with-its-correct-description-by-analyzing-the-components-of-the-n/T5NqiJxzLDnzjyvXxlUn</loc>
            <lastmod>2025-10-03T06:02:25.463Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-an-arbitrary-shaping-function/T8R6BVxc1Gw0TTBVae3V</loc>
            <lastmod>2025-10-06T14:30:24.417Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/characteristics-of-teacher-and-student-models-in-knowledge-distillation/T8gBeR2fZwUhgv0FASDF</loc>
            <lastmod>2025-10-10T07:52:56.562Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/post-incident-root-cause-and-remediation-plan-for-an-llm-feature-release/TA5ws4n5eCQTZXs8U3ob</loc>
            <lastmod>2026-02-06T18:24:44.003Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evolution-and-impact-of-prompting-in-nlp/TAkNxMp4yw8FhDpT6lFD</loc>
            <lastmod>2026-04-30T22:55:01.443Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-using-an-ai-to-generate-preference-data-to-train-a-customer-service-chatbot-for-the-cus/TEkpX4acS3O79HqyfbFN</loc>
            <lastmod>2025-09-26T09:02:31.445Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-fine-tunes-a-very-capable-state-of-the-art-model-using-labels-generated-by-a-much-ol/TIIb8BZqVFQOb9CoLrHg</loc>
            <lastmod>2025-10-06T11:22:23.625Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-data-centric-alignment-strategy/TKovOl91FPfPEtEfdvfg</loc>
            <lastmod>2025-10-06T02:46:17.629Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sourcing-fine-tuning-data-from-qa-websites/TLrlQhfnWsmmkbM6HC5F</loc>
            <lastmod>2026-05-01T01:05:13.629Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-soft-prompt-optimization/TO7IvMR0vCdSe9m36qXy</loc>
            <lastmod>2025-09-26T06:07:13.251Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-health-decisions/TOxV9yTqYNowY4YQaMyn</loc>
            <lastmod>2025-10-05T17:00:44.876Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/predicting-pre-trained-model-behavior/TPUP52XPBQa99cuBXvPg</loc>
            <lastmod>2025-10-06T21:00:35.480Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-setting-the-update-for-a-policy-atst-depends-on-a-gradient-calculation-f/TQG5ABWBn7QgdAczf9bN</loc>
            <lastmod>2025-10-01T18:58:33.585Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/aspect-based-reward-model-construction-in-rlhf/TRKZWMdq41OLaVFzQ3SO</loc>
            <lastmod>2026-05-03T00:24:39.231Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-prompting-strategy-for-different-model-tiers/TRan9IqrrPCMSqAIly3d</loc>
            <lastmod>2025-10-10T08:12:14.535Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-strategy-for-a-niche-ai-application/TRfcnnSf5ACsM6zHJxH0</loc>
            <lastmod>2025-10-10T06:24:00.505Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-company-is-building-an-internal-it-helpdesk-a/TSgiwvLRDF7Any0sIWMd</loc>
            <lastmod>2026-02-08T13:57:05.986Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-sequential-process-that-ranks-a-set-of-four-documents-d-d-d-d-resulting-in-the-final-rank/TTiFUtIn7tW8someL6Zx</loc>
            <lastmod>2025-10-08T14:04:21.535Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-system-designed-to-align-a-language-model-with-human-preferences-one-component-functions-as-a-c/TWwj4QTeVg236p4WLg1i</loc>
            <lastmod>2025-10-01T22:04:49.194Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/inference-time-alignment-as-an-alternative-to-fine-tuning/TYW9NM8y5Tv6qeT1vOvw</loc>
            <lastmod>2026-05-03T15:23:39.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-data-analyst-is-studying-the-relationship-between-two-variables-from-a-fixed-budget-of-the-amount-/TYYbekLkVTSlzHfRUc3M</loc>
            <lastmod>2026-04-26T18:31:40.148Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/assessing-the-viability-of-a-model-update-strategy/TZ5jITBOIP46lE5tw536</loc>
            <lastmod>2025-09-28T17:37:48.069Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/knowledge-distillation-loss-using-kl-divergence/TaBZVttB32QKN450K2E8</loc>
            <lastmod>2026-07-04T07:37:11.977Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/model-prediction-vs-ground-truth/TaLQF5UQ55JymndDboiT</loc>
            <lastmod>2025-10-03T21:48:59.076Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/perfect-positive-correlation/TaWVny9kfookgq92Fi71</loc>
            <lastmod>2025-10-08T12:33:07.316Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-trained-to-summarize-news-articles-when-tested-on-the-exact-same-set-of-articles/TaXe1RDnPjfQJCQclgSA</loc>
            <lastmod>2025-10-08T12:35:39.101Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-mathematical-derivation-of-the-direct-policy-optimization-dpo-objective-function-is-completely-i/TbHA2AFVVpY54o2i2XTc</loc>
            <lastmod>2025-10-02T21:06:12.679Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-policy-optimization-training/TbOmT4sUC9jq6oKta7JZ</loc>
            <lastmod>2025-10-07T09:31:04.036Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-a-simple-prompt/Tdsi9KWJr4bGP52DvZdY</loc>
            <lastmod>2026-04-30T19:55:53.050Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-and-filtering-self-generated-instruction-data-when-bootstrapping-a-strong-model-from-a-wea/Teu880Pu6nvZTuDpDyhY</loc>
            <lastmod>2026-02-08T13:57:02.016Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-the-advantage-for-a-single-token-generation/TiKabmrUq9Vhfyhajx7D</loc>
            <lastmod>2025-10-07T09:34:48.521Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prompt-for-a-problem-solving-task/Tkr1PXXpBkx1GciuRWnM</loc>
            <lastmod>2026-02-09T19:44:58.915Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-learning-to-play-a-game-where-the-goal-is-to-maximize-its-final-score-at-a-specific/TnbAhrWUCmqy26PTWpcj</loc>
            <lastmod>2025-10-06T11:15:11.523Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-an-objective-function-formulation/TpD0V7tnbqor0rDvRJ3q</loc>
            <lastmod>2025-10-02T09:48:42.844Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-notation-for-autoregressive-models-pitheta/TqvZ8GGPikRBvDOFKy5x</loc>
            <lastmod>2026-06-26T20:30:30.292Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-new-robotic-arm-policy/TsG7FWBio7kI2U1LG2Nk</loc>
            <lastmod>2026-06-29T07:14:54.434Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-algorithm-a-baseline-is-subtracted-from-the-total-reward-to-stabilize-th/TtgchPwTYYaHHvtMQEIO</loc>
            <lastmod>2025-10-01T20:34:34.632Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-llm-consistency-in-a-team-setting/TuKnNlulhMvyHZe0haSm</loc>
            <lastmod>2025-10-02T21:15:46.088Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-fine-tuned-on-a-dataset-for-the-input-translate-to-french-i-love-to-learn/TwnjPOjGfqgUmKweSDh6</loc>
            <lastmod>2025-10-04T02:43:33.342Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/cancer-early-detection-when-to-seek-medical-help/Tyb57DKGkyWM0jGG7gbS</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-a-chatbot-for-complex-queries/TzCNdY5YCepCuYIpt4Jv</loc>
            <lastmod>2025-09-28T22:45:10.492Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generating-n-best-candidates-in-bon-sampling/TzhSgCf0vp8zBRtAxPS3</loc>
            <lastmod>2026-05-03T15:32:37.828Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-developing-a-critical-ai-system-to-summarize-legal-documents-to-ensure-the-highest-poss/TzyDugGLs3FxOog7uqE5</loc>
            <lastmod>2026-04-30T13:36:15.409Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/system-architecture-analysis/U0uPSSrwMP91rO57ckhq</loc>
            <lastmod>2025-10-06T11:35:04.825Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/weak-to-strong-fine-tuning-as-a-knowledge-distillation-problem/U1CrBpQzi4jDIIQLkwbg</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/learning-curve-effect-on-photovoltaic-cell-prices/U2GDM2YV0EAIVBIV9Hls</loc>
            <lastmod>2025-09-16T15:58:17.903Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rlhf-policy-optimization-objective/U3nLvmEA5APug0qAumBj</loc>
            <lastmod>2026-05-03T00:35:05.407Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/visual-diagram-of-combined-loss-training-for-weak-to-strong-generalization/U5ApFzcA6ioTpLLXnSVK</loc>
            <lastmod>2025-10-09T03:32:05.395Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/two-levels-of-generalization-in-instruction-tuned-llms/U5gPfKeh5B79w4OS9mJM</loc>
            <lastmod>2026-06-29T07:28:49.847Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-policy-gradient-implementation/U89G6sMQICNuHgwytSP2</loc>
            <lastmod>2025-10-08T14:33:45.096Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/off-policy-objective-function-with-importance-sampling/U8JRd2WlSZhg8ahrYbLj</loc>
            <lastmod>2026-06-28T17:32:59.284Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-software-developer-is-building-a-system-to-archive-a-large-collection-of-legal-documents-they-need/U8vnu3nQbPjxpEdPIMh5</loc>
            <lastmod>2025-10-06T14:44:50.160Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-language-model-is-undergoing-a-single-step-of-fine-tuning-on-a-new-dataset-arrange-the-follo/UAmvAIGbnVwzkCFAUuxN</loc>
            <lastmod>2025-10-05T20:15:25.398Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/inference-time-llm-alignment/UFNSfLqTCdl7f2HphVCr</loc>
            <lastmod>2026-04-30T23:28:02.148Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-problem-of-llm-misalignment/UHB3ABfzxQqu0UkgHt8u</loc>
            <lastmod>2026-04-30T23:03:25.878Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-the-success-of-model-adaptation/UHYirHfIKhkDtHNOpTxv</loc>
            <lastmod>2025-10-06T18:59:57.601Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/size-and-specialization-of-sft-datasets/UHcpOqI9tgswb1l3lb77</loc>
            <lastmod>2025-10-06T16:42:45.848Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/parameter-updates-in-supervised-llm-training/UHm6Vq4wVWIt9KviUXwO</loc>
            <lastmod>2025-10-08T23:25:36.424Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-fine-tuning-a-large-language-model-they-have-access-to-a-small-high-quality-dataset-with-v/UIFXGbKIoVXZ5oHirASb</loc>
            <lastmod>2025-10-02T06:02:29.313Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-the-right-tool-for-decision-making/UIXi42nogYW4RZZtHFTE</loc>
            <lastmod>2025-10-07T11:47:43.430Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-text-generation-system-adjusts-the-likelihood-of-different-outputs-using-the-formula-newlikeli/UL5ADBq8w6BL5znhwbi8</loc>
            <lastmod>2025-10-07T08:10:12.884Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-grid-world-reward-function/UOPGqwE1FPWBiKagYrmM</loc>
            <lastmod>2025-10-08T23:57:38.273Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-implementing-a-penalty-based-trust-region-for-policy-optimization-where-the-goal-is-to-maximize/UOdpW2Iq6fFBG2WsgHOR</loc>
            <lastmod>2025-10-10T10:32:16.208Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/lima-dataset/UOhUfvQLvAGqOMXkjCx8</loc>
            <lastmod>2026-05-12T16:51:43.077Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formal-definition-of-intra-task-generalization/UQCF79lpb4vaJnvl4gyG</loc>
            <lastmod>2026-06-30T23:55:44.525Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evolution-of-the-concept-of-alignment-in-nlp/UQOmXgOBeNDsBoiSrgNL</loc>
            <lastmod>2025-10-06T16:45:08.245Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-deployment-strategy-for-a-startup/UQWCEWf1PX4rFUeA86qK</loc>
            <lastmod>2026-02-08T13:19:59.305Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-an-off-policy-evaluation-scenario-where-the-performance-of-a-target-policy-is-estimated-usi/UR9YxvbMXDRQZCsjujO4</loc>
            <lastmod>2025-10-08T20:53:35.926Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-training-a-reward-model-for-a-chatbot-designed-to-generate-creative-and-humorous-/UUwuz0WBnTniq7Do8BvF</loc>
            <lastmod>2025-10-05T23:52:25.470Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/derivation-of-the-advantage-function-estimator/UY6Nr2c6dcu5TZZCWbpT</loc>
            <lastmod>2025-10-06T18:28:07.990Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-human-preference-ranking-in-rlhf/UYFOitkc517BqXZvOWWg</loc>
            <lastmod>2026-06-25T22:19:24.855Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/agent-environment-interaction-loop-in-reinforcement-learning/UYJCC92GtGaE8EoS9NdR</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-model-generated-three-different-responses-a-b-and-c-to-a-users-prompt-a-human-reviewer-provide/Uc2vZbWOC1G4VuUIJkt4</loc>
            <lastmod>2025-10-04T03:28:06.428Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fusion-networks-for-combining-reward-models/Uc5ZxU8Xy8JvA5eM10v2</loc>
            <lastmod>2026-05-03T00:23:46.155Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/correcting-fine-tuning-parameter-notation/UgM7jKCb52NC6yx83Zas</loc>
            <lastmod>2025-10-07T11:53:51.727Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-memory-architecture-for-long-context-enterprise-summarization/UhJqPGjiVslbhBFv8w0M</loc>
            <lastmod>2026-02-06T18:30:47.284Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-models-preferences-by-first-assigning-a-numerical-reward-score-to-a-response-and-then-conve/UhXNaQuCLK9m38l1c2iK</loc>
            <lastmod>2025-10-08T23:21:34.909Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-small-research-team-with-limited-funding-is-developing-a-specialized-chatbot-for-quantum-physics-t/UilJDSU2oPt1JBb5XaNE</loc>
            <lastmod>2025-10-02T04:17:39.578Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-financial-data-extraction-using-a-prompt/Uly5a0IViYEqMcJ60sQb</loc>
            <lastmod>2026-06-27T17:55:01.398Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-model-performance-metrics/UmGhrbPp8nB0P8evw94x</loc>
            <lastmod>2025-10-07T11:59:33.265Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-the-pointwise-method-in-rlhf/UmRJcxrnXG0VRPi5EiCc</loc>
            <lastmod>2026-05-02T23:49:18.332Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/solution-to-kl-divergence-minimization-for-policy-optimization/Ur0iExM8EZBj6H2PHinE</loc>
            <lastmod>2026-05-03T00:50:39.538Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generating-fine-tuning-samples-for-machine-translation/UrrMjH7qtKwXtcHYDDIV</loc>
            <lastmod>2026-05-01T00:58:35.157Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consequences-of-policy-regularization-strength/Ux0gg5k5QfLA9ZvhWGeO</loc>
            <lastmod>2025-10-04T05:09:55.357Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sfts-reliance-on-labeled-data/UxjyqjubaahiyaHsaMXQ</loc>
            <lastmod>2026-05-01T00:45:47.066Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-assistant-development-strategy/Uy5ZqMvcuE5MBoGClO4u</loc>
            <lastmod>2025-10-05T18:46:24.472Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-ranking-error-penalties/UzQV95q2RbwNagespNfP</loc>
            <lastmod>2025-09-26T15:11:31.823Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-starts-with-a-large-language-model-that-has-been-pre-trained-on-a-vast-corpus-of-/V11KMwSQzPpbAHOMC9hP</loc>
            <lastmod>2025-10-05T16:57:49.958Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-public-feedback-system/V4apkMRNtDtEZatz9PVq</loc>
            <lastmod>2025-10-06T02:37:09.311Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-was-given-the-following-text-and-a-specific-set-of-instructions-analyze-the-four-re/V5V8R0Aeej8x8sTfSvp0</loc>
            <lastmod>2025-10-05T17:27:22.620Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-an-off-policy-reinforcement-learning-scenario-an-agent-is-in-a-specific-state-the-policy-that-ori/VGiwsziQ320Xe4yK5Cbb</loc>
            <lastmod>2025-10-06T20:27:03.209Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-the-policy-divergence-penalty/VGm04Dg1aILe4YWRSvAu</loc>
            <lastmod>2025-10-08T20:15:00.047Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-given-the-input-the-cat-sat-on-and-begins-to-generate-the-next-part-of-the/VGnAaqP0x719LMMiwCWi</loc>
            <lastmod>2025-09-26T03:31:19.169Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-fine-tuning-data-strategy/VHBb0KocZN5Ia8zleKos</loc>
            <lastmod>2025-09-28T16:30:37.515Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/conceptual-objective-function-assumed-in-dpo/VIyoQBO8lkExO0STq0zm</loc>
            <lastmod>2026-05-03T00:44:52.767Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-model-to-automatically-assign-a-quality-score-to-an-ai-generated-response-to-/VJKMe2WpI2BwTr2XlzOe</loc>
            <lastmod>2025-10-02T04:39:26.473Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-reward-system-for-a-robot-dog/VJeRBHPhVVanmEnbji2q</loc>
            <lastmod>2025-10-06T21:58:50.212Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autoregressive-language-model-is-generating-the-two-token-response-good-day-given-a-prompt-the-ta/VOFr7Oes80MWZoHgIQCM</loc>
            <lastmod>2025-09-28T12:20:56.177Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/trade-offs-in-context-representation/VQQovILoOhw275zDRWy6</loc>
            <lastmod>2025-10-06T20:21:04.613Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-translation-system-is-designed-to-translate-the-english-sentence-hey-whats-up-into-french-/VXLW6gDwZxzVqkZ2CGuC</loc>
            <lastmod>2025-09-29T01:53:30.579Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-state-representation-for-a-self-driving-car/VYcz4bIbJCl7WMpYp17G</loc>
            <lastmod>2025-10-06T13:30:11.427Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-function-assigns-the-following-unnormalized-scores-to-three-possible-discrete-outcomes-scorea-scor/VYrEHWAmv1qROvo28D6B</loc>
            <lastmod>2025-10-02T04:28:11.824Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/efficiency-in-policy-optimization-implementation/VYuLyLhyH9JSl6JYfKb3</loc>
            <lastmod>2025-10-04T03:31:36.205Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-model-output-probability/VYwQs0CLHRnY03khrEOB</loc>
            <lastmod>2026-02-08T14:18:34.689Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-establishes-a-notational-convention-where-a-represents-the-multiset-a-a-a-a-later-in-th/VZDj6yCmypnTAYyyj8TY</loc>
            <lastmod>2026-04-29T04:19:17.670Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ensemble-learning/VZsEoHv3QSTGTqH4EmIk</loc>
            <lastmod>2026-05-01T15:27:12.329Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/initial-step-in-creating-machine-translation-fine-tuning-data/Vb1ZLFTErLzoVeZ4YJlM</loc>
            <lastmod>2026-05-01T00:58:20.088Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-emergence-of-instruction-following-at-scale/VbILRn7j8AlKZkL10q3j</loc>
            <lastmod>2025-10-06T13:39:55.345Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-variable-relationships-in-a-business-scenario/VcLQRBBL2W7JAvxeBrE5</loc>
            <lastmod>2025-10-03T17:02:08.410Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-generates-two-different-summaries-for-a-given-article-summary-and-summary-a-human-e/VejVamXUNUHvRURxRyaH</loc>
            <lastmod>2025-09-28T19:31:13.238Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-single-training-step-in-language-model-fine-tuning/VeqfploC7TPEyYFS8NVF</loc>
            <lastmod>2025-10-07T08:20:37.728Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/conceptual-advantages-of-pointwise-methods-in-rlhf/Vf0hBww7NyfaqyfrikuK</loc>
            <lastmod>2026-05-02T23:49:53.278Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-key-advantage-of-implementing-a-potential-based-reward-shaping-function-is-that-it-fundamentally-a/VfG4gl7OqNnKsNYMF5dK</loc>
            <lastmod>2025-10-06T22:05:13.309Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-text-generation-model-is-being-optimized-to-produce-high-quality-responses-the-process-starts-with/VfoapJ6Hw0U3s7WZH21q</loc>
            <lastmod>2025-09-26T09:18:13.433Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-has-fine-tuned-a-large-language-model-primarily-to-follow-user-commands-the-m/Vh9jMj6UKgSGE7vEY5DD</loc>
            <lastmod>2025-09-26T09:29:40.733Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-to-generate-helpful-and-harmless-responses-using-feedback-from-a-s/VkYGEJXvtfNbReCunSfG</loc>
            <lastmod>2025-09-26T14:47:34.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-is-planning-to-create-a-new-instruction-tuning-dataset-using-a-team-of-highly-skilled/VoQstRZHkfSEItJtG0XH</loc>
            <lastmod>2025-10-03T01:26:59.587Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/definition-of-the-advantage-function/VoSKRnkS5LbVCazuXkez</loc>
            <lastmod>2026-05-01T16:45:57.252Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-analyzing-the-weekly-sales-performance-of-its-different-retail-stores-let-the-variable-/VqKgYbB2eqelm1ucj5HO</loc>
            <lastmod>2026-07-04T00:11:54.724Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-agent-using-an-actor-critic-architecture-the-critic-network-is-being-tra/VtQbZq8299mGZr58lqqM</loc>
            <lastmod>2025-09-28T17:42:27.883Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-is-being-trained-using-a-utility-function-that-incorporates-an-upper-/Vu1lA5NnbOBRiHrcnwxV</loc>
            <lastmod>2025-09-26T04:04:55.195Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/from-theory-to-practice-expected-vs-empirical-loss/VuKx8PeYGNbNPs03KLcv</loc>
            <lastmod>2025-10-07T09:00:54.201Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/figure-the-price-of-photovoltaic-cells/VuPS2UeCxEYIQBjOT50g</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/multi-task-learning-via-instruction-fine-tuning/VuUJDMBUq9ldMUsGrZon</loc>
            <lastmod>2026-02-08T14:09:59.780Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimization-strategies-for-fine-tuning/VuzLZib7Y4CEVIU7PMD1</loc>
            <lastmod>2026-05-01T00:47:24.644Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/distinguishing-maximum-value-from-optimal-argument/VvCfTyn8srKugeGqK2Kl</loc>
            <lastmod>2025-10-08T14:56:39.378Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-segmentation-strategies-for-a-creative-writing-ai/VvIyMP1kFNbFMX3RngiJ</loc>
            <lastmod>2025-10-06T23:09:28.937Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-preparing-data-to-teach-a-pre-trained-language-model-how-to-follow-sp/Vw6n6btNgEcClbya5C5x</loc>
            <lastmod>2025-09-28T12:39:30.274Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/general-objective-for-parameter-optimization-via-loss-minimization/VwPKcKoUASyaOotkt7XK</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/notation-for-a-set-of-output-segments/Vyjq5b48ShwXvKQSDWOf</loc>
            <lastmod>2026-06-30T08:41:33.813Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-dialogue-model-on-a-dataset-of-conversations-each-containing-multiple-turn/VzCBDfgimqpbHOzuijUP</loc>
            <lastmod>2025-09-26T10:48:43.796Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-the-training-objective-for-a-language-model-policy-consider-the-following-formula-/VzHwn64a121G4nEczyXH</loc>
            <lastmod>2026-05-03T00:35:23.712Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-prompting-technique-with-the-description-that-best-defines-its-core-approach/VzdNypyHqFFwdwrrOzS8</loc>
            <lastmod>2025-10-06T23:38:01.226Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/unintended-consequences-of-data-filtering/W4Aj501eOikxNuOxBC4o</loc>
            <lastmod>2025-10-05T20:30:15.675Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-models-generalization-failure/W6O2Wr5Fsf7dSrr7sdTL</loc>
            <lastmod>2026-02-08T14:18:22.283Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-process-where-the-outcome-at-step-k-is-determined-by-a-function-s-this-function-takes-a-s/W7lK5nGaUQRvV8z4bzO4</loc>
            <lastmod>2026-06-30T00:53:26.406Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-implementing-a-reward-model-to-score-a-response-generated-for-a-given-prompt-arr/W80HQUaggIKl2kO4Hr8F</loc>
            <lastmod>2025-10-03T00:05:55.984Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-preference-models-suitability/WBLB24hhVqdQp7GOSCtj</loc>
            <lastmod>2025-09-28T11:34:04.297Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/alternative-methods-for-soft-prompt-optimization/WBvUZUQ3quEbpSAaX3es</loc>
            <lastmod>2025-10-10T09:03:06.247Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-an-automated-data-generation-process/WBvVEaTlhbnlKodMyhkT</loc>
            <lastmod>2025-10-05T18:00:49.674Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-manual-data-generation-for-fine-tuning/WH80mRWgengp2H5TZ3cK</loc>
            <lastmod>2026-05-01T01:25:02.567Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-prompt-for-technical-troubleshooting/WHr6pv76NgbBEukh15B3</loc>
            <lastmod>2025-10-09T03:53:28.185Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/pre-training-objective-choice-for-a-multi-modal-enterprise-writing-assistant/WJ7OuF4FsY4jOV6ofQWy</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/function-of-a-sequence-of-average-vectors-notation-sbarmathbfy-dots-barmathbfyk/WKoclDjnrEKlFGIKs9yY</loc>
            <lastmod>2025-10-08T21:08:46.626Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-large-language-model-for-deployment-on-a-resource-constrained-mo/WNDl4RiyimbUItMSdSbO</loc>
            <lastmod>2025-10-06T17:16:37.525Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-language-models-training-objective/WNM2WGRNKuBsGVjyMEye</loc>
            <lastmod>2025-10-08T15:53:36.753Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-following-formula-for-a-loss-function-used-to-train-a-model-on-ranked-lists-of-outputs-/WUMJbpp2RhZZT0wSVdwN</loc>
            <lastmod>2025-09-28T17:59:41.839Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/supervising-intermediate-reasoning-steps-for-llm-alignment/WVms6k0Z3xBy61lSKk1Q</loc>
            <lastmod>2026-05-03T01:24:44.077Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/justifying-synthetic-data-in-llm-development/WWTg82UchcVtWIbaw73v</loc>
            <lastmod>2025-10-06T23:28:09.877Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-gradient-algorithm-a-researcher-attempts-to-reduce-the-variance-of-the-gradient-estimate/WXctAjkC3AxWJ3oza492</loc>
            <lastmod>2025-10-07T09:17:20.751Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-detailed-task-description-for-a-healthcare-and-finance-qa-model/WYQBlwrhQS1xJpigWgHu</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-multi-model-chatbot-system/WaCFYemKDYH9MMylahzo</loc>
            <lastmod>2026-04-30T13:36:15.409Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-requirements-in-model-training-phases/Wc9uXNfCAEhPkVxM7lay</loc>
            <lastmod>2025-10-07T00:08:42.047Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-function-as-a-linear-transformation-of-the-last-hidden-state/WcIgb44XbzxIlcKGssa4</loc>
            <lastmod>2026-06-29T03:27:27.420Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autonomous-agent-in-a-reinforcement-learning-environment-is-in-a-particular-state-from-this-state/WcjvLKcg5s82Sygz5AHR</loc>
            <lastmod>2025-09-29T02:48:47.277Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autonomous-system-is-being-trained-to-play-a-board-game-against-a-human-the-system-perceives-the-/WddCiDZ0fkUsQdRfNmgd</loc>
            <lastmod>2025-09-26T12:58:58.397Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-an-llms-instructional-failure/WdqZmCgseWKkiWrMplE9</loc>
            <lastmod>2025-10-06T03:28:52.879Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-is-trained-to-find-the-exit-in-a-maze-two-reward-models-are-proposed-/WeqcqLCDGEbKtq3yWf2K</loc>
            <lastmod>2025-10-02T05:40:12.490Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-reward-decomposition/WfLw2fEkkgaNchrP5MYQ</loc>
            <lastmod>2025-10-08T16:49:15.985Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critiquing-the-perfect-dataset-hypothesis-for-alignment/WgN865bK2g0QhJjVOAvX</loc>
            <lastmod>2025-10-07T10:14:03.678Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-model-adaptation-strategy/WgWMS5vlxSvSFFmETQQi</loc>
            <lastmod>2025-10-03T04:19:30.592Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fixed-size-kv-cache-for-long-context-inference/WgbH6bnEXaAZC5VfRPq6</loc>
            <lastmod>2026-04-30T22:27:44.264Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-a-machine-translation-fine-tuning-sample/Wi3uwUIRfu4mXI40mOE1</loc>
            <lastmod>2025-10-10T05:02:13.096Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-negative-segment-scores/WiputbJDcTJf9ZqjcIUz</loc>
            <lastmod>2025-10-10T01:40:23.986Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/components-of-reward-model-parameters/Wjkds5D0PpBXTogEO4yz</loc>
            <lastmod>2025-10-07T09:05:26.546Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-provides-a-language-model-with-the-following-prompt-which-includes-an-instruction-and-a-text-/WjqZmCn45zApeMnidkse</loc>
            <lastmod>2025-09-26T15:25:05.174Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generation-of-candidate-outputs-from-input-only-datasets-in-rlhf/WpmGj9E0EKwXSkGXo4ve</loc>
            <lastmod>2025-10-07T10:07:10.218Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-model-loss-behavior/WqLRvxgNWRKsIBT7cSFT</loc>
            <lastmod>2025-10-08T15:12:26.801Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-fine-tuning-a-very-large-computationally-expensive-language-model-on-a-massive-no/WrYKxpVyi6G53vqqqxR7</loc>
            <lastmod>2025-09-29T12:29:29.395Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-reward-model-score-inflation/WsKm3Wej2ZPdo9rPBR0R</loc>
            <lastmod>2025-10-08T23:18:02.581Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/pre-launch-risk-acceptance-memo-for-a-regulated-industry-llm-assistant/WtslNTXSK6cZCoBvUHlE</loc>
            <lastmod>2026-02-06T18:26:17.811Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-the-predictive-inference-formula/Wu3YSjxiuTCvBIY7zqvA</loc>
            <lastmod>2026-06-21T21:52:27.886Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-supervised-fine-tuning-for-value-alignment/WuFDpm5UXiOtK5ytleTo</loc>
            <lastmod>2025-10-06T12:38:10.994Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-training-and-fine-tuning/Wun1wxrlOIgzM5k1IuFJ</loc>
            <lastmod>2025-10-10T05:08:38.510Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-is-being-trained-using-a-policy-gradient-method-during-training-the-a/Wx1tx0fluHkNE0WeCBDL</loc>
            <lastmod>2025-10-03T03:59:48.103Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/which-of-the-following-statements-best-analyzes-the-co-evolutionary-relationship-between-the-increas/WxHGQczyGvXtuuKxLcNh</loc>
            <lastmod>2025-10-02T19:15:18.980Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/credit-assignment-in-ai-poetry-generation/WzVS6ggC0uOX0i65SL9y</loc>
            <lastmod>2025-10-06T02:53:17.870Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-llm-adaptation-strategies/X0OpSlQgl0HFbsNzabMV</loc>
            <lastmod>2025-10-07T15:05:32.846Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/modeling-preference-probability-with-the-bradley-terry-model-in-rlhf/X30q9iMVv6BpY3aLgUaD</loc>
            <lastmod>2025-10-06T19:11:27.409Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/agent-performance-calculation/X3aciVdqRBwSsjmGGekR</loc>
            <lastmod>2025-09-28T19:28:17.101Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sequence-to-sequence-models-for-text-simplification/X5AePrNPgeC0sRNnxVQe</loc>
            <lastmod>2025-10-06T17:44:26.303Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/relationship-between-consecutive-sets-in-sequential-ranking/X5oDB6MocMQyjBjKVEKz</loc>
            <lastmod>2025-10-03T19:14:30.136Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/learning-from-human-feedback/X7x7nuTezEDh8dsBZlmy</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/automated-task-creation-for-a-marketing-dataset/XA7zS1ViZkhDfIuth8VP</loc>
            <lastmod>2025-10-05T18:30:44.738Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-training-conclusion/XBI817sFl9qJoX7ceUDC</loc>
            <lastmod>2025-10-08T21:04:39.197Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/differing-motivations-of-instruction-and-human-preference-alignment/XCJF5ngRPCpxCH0bXk5g</loc>
            <lastmod>2026-04-30T23:12:49.776Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-hard-and-soft-prompts/XDfFVeUuXL1jVg6j1kyA</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/email-filter-error-analysis/XGvWoGZ0N9cYQfleVzGb</loc>
            <lastmod>2025-10-09T00:48:11.100Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-freezing-the-reference-model-in-rlhf/XH5p1cdZwVO2bp6hnrYs</loc>
            <lastmod>2025-10-05T18:34:34.656Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-using-a-large-language-model-to-generate-a-synthetic-dataset-for-training-a-sentiment-clas/XJ8WJGHPs2NS75o6m8zo</loc>
            <lastmod>2025-10-05T17:42:12.314Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/upper-bound-clipping-function-for-policy-ratios/XNr9AvG5FHccQ2naYqmQ</loc>
            <lastmod>2026-07-01T19:46:06.497Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-preference-labeling-performance-with-prompting-techniques/XOvRaHsKY7ZEqSQi1emo</loc>
            <lastmod>2026-05-03T01:10:25.447Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-language-model-for-a-highly-specialized-and-stable-task-where-maximi/XPmihGQ7fLjv734mKGZC</loc>
            <lastmod>2025-10-10T07:57:38.096Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-soft-prompt-optimization-via-log-likelihood-maximization/XQVJeLsLOxE4CFv63lpS</loc>
            <lastmod>2026-06-25T22:46:11.347Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/supervised-fine-tuning-sft-as-an-example-of-labeled-data-fine-tuning/XTMSjqmx82cUkCJVCQNM</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/role-of-the-loss-function-in-policy-learning/XTSOaEfY8EHqoKKTQdfE</loc>
            <lastmod>2025-10-03T04:45:15.189Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-reward-model-for-chatbot-helpfulness/XTkJoUCsFP8TQ6En0c4W</loc>
            <lastmod>2025-10-07T09:10:07.994Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-is-reviewing-two-proposed-alignment-impl/XVL5KXkmLaqvALj5y2W2</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generalization-from-supervised-fine-tuning/XWVvDVvYj5UhcVaHFNjB</loc>
            <lastmod>2026-04-30T23:15:21.340Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-to-prefer-one-machine-generated-text-response-over-another-for-a-giv/XXH29jq9Y2jkECMupcQq</loc>
            <lastmod>2025-10-02T03:11:14.138Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-an-ai-customer-service-agents-misalignment/XYXfGWWeLxv6VahzFWD9</loc>
            <lastmod>2025-10-06T11:28:58.231Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-translation-model-failures/Xa0AzjitWLHqHch5kB2l</loc>
            <lastmod>2026-04-19T20:35:04.310Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-llm-prediction-with-compressed-context/XcjW0L4iMOR0izIQGInj</loc>
            <lastmod>2026-07-03T23:21:49.092Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-the-policy-regularization-penalty/XevUGxmcScISszJ8IA0L</loc>
            <lastmod>2025-10-09T00:08:24.358Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/if-a-dataset-used-for-training-a-preference-model-is-extremely-large-the-average-loss-calculated-ove/XfMWmkKmRjUnwikHxNu7</loc>
            <lastmod>2025-10-07T10:32:10.525Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/addressing-post-tuning-model-flaws/XfdTOBI5AUyC4MBoRWHd</loc>
            <lastmod>2025-10-05T20:16:47.715Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/computational-cost-of-fine-tuning-with-large-datasets/XiKYcxZvrtnmgYtqeUrr</loc>
            <lastmod>2026-02-08T14:07:27.698Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/computational-expense-of-sft-for-large-language-models/Xiknys3KYcRZXrg6da2e</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-generating-text-and-has-so-far-produced-the-sequence-the-sky-is-the-model-now-ne/XkpIOwD3KkrTWZH0n5Bj</loc>
            <lastmod>2025-09-28T06:57:56.912Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-training-a-model-to-predict-scores-for-a-given-input-output-pair-consider-the-foll/XlkTbCJ9MALj3yiWiHxa</loc>
            <lastmod>2025-10-08T23:32:51.583Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-fine-tunes-two-language-models-model-a-is-trained-on-examples-of-a-single-nar/Xm26aoPCo7nttJpNnbx3</loc>
            <lastmod>2025-10-02T10:48:43.487Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-system-to-provide-granular-quality-scores-for-long-multi-paragraph-articles-g/XqHe9vTSLDXU0ELicZUG</loc>
            <lastmod>2025-09-28T19:25:34.586Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-training-instability-in-reinforcement-learning/XrRZljbzkKwawRKF2h4M</loc>
            <lastmod>2025-10-02T18:14:03.526Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-synthetic-instruction-fine-tuning-pipeline-under-budget-and-quality-constraints/XsnfnjxgA1D4fWHcsVz8</loc>
            <lastmod>2026-02-08T13:57:01.786Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-data-diversity-in-reward-model-ensembles/XtmI09G0DHygZtqNPhKM</loc>
            <lastmod>2025-10-07T00:31:22.403Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-large-scale-fine-tuning-dataset-flan/XvM7O1dO9fQEA3mV48FA</loc>
            <lastmod>2026-05-01T10:28:52.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-model-is-asked-how-to-synthesize-a-common-household-cleaning-chemical-the-model-provides-a-che/XvSzX3nFvYiK7GBvqClV</loc>
            <lastmod>2026-02-08T13:19:09.329Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critic-network-loss-in-ac/Xvw3XAswYwNEejFh9kIA</loc>
            <lastmod>2026-05-01T16:46:56.694Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-is-designed-to-process-a-single-input-by-feeding-it-simultaneously-to-several-independent-s/XwKeVEQAS7rozWZoawJf</loc>
            <lastmod>2025-10-06T11:20:45.186Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/model-parameterization-by/XwwTev0ovaUTSQT6GjME</loc>
            <lastmod>2026-06-28T20:54:41.445Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generating-synthetic-data-with-a-weak-llm-for-instruction-fine-tuning/Xx5TDRf6Scf3FA23Zo18</loc>
            <lastmod>2026-05-01T15:10:42.703Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-penalty-coefficient-on-llm-fine-tuning/Y389Zyc3KoPQUrlIMBbe</loc>
            <lastmod>2025-10-03T19:53:54.385Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sample-efficiency/Y3TzL3tvaRkUquF6C1s1</loc>
            <lastmod>2026-05-01T10:36:15.996Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-uses-an-iterative-process-to-automatically-generate-a-large-instruction-tuning-dataset-starti/Y4EeBbThPxdmw691mcZx</loc>
            <lastmod>2025-09-28T18:08:22.824Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-analogy-of-a-student-hacking-their-homework-match-each-element-of-the-scenario-to-the-corresp/Y60XVwA8S1T5sReZsGLE</loc>
            <lastmod>2025-10-04T08:09:19.893Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limited-scope-of-fine-tuning-data-for-downstream-tasks/Y6p4h2Jgm0rCIZCKwQ2e</loc>
            <lastmod>2026-05-01T10:30:50.474Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-discussion-about-the-statistical-properties-of-a-models-output-a-researcher-writes-the-followin/Y7HSOgGadinvCP3gofOt</loc>
            <lastmod>2025-10-04T05:12:38.492Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/effect-of-temperature-scaling-on-a-reward-modified-distribution/Y9jEjUvaMPkZ8e5wQuUU</loc>
            <lastmod>2025-10-08T16:10:57.246Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-using-an-iterative-method-to-expand-a-small-set-of-seed-instructions-into-a-large-dataset-/YAcyPRJK42Dg1X388lj5</loc>
            <lastmod>2025-10-05T20:20:53.038Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-language-model-is-fine-tuned-exclusively-on-a-dataset-containing-question-answer-pairs-about/YBTH61UaMbesw3UFYlFu</loc>
            <lastmod>2025-10-10T02:50:08.443Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/combining-multiple-reward-models-to-mitigate-overoptimization/YBl2aDKjRJJ4iJtsxKyF</loc>
            <lastmod>2026-05-03T00:18:44.799Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-system-using-a-reinforcement-learning-approach-the-systems-behavior-is-det/YF3uIkLktx8xegsF16lP</loc>
            <lastmod>2025-09-29T12:20:20.373Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-engineer-is-working-with-a-pre-trained-large-language-model-whose-probability-distribution-is-/YGTTCJT41bep5CSSdz8N</loc>
            <lastmod>2025-10-06T11:30:29.509Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-simplification-in-direct-policy-optimization/YJLxqerOJ6ssrkh2Rvoz</loc>
            <lastmod>2025-10-10T08:05:58.547Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-model-uses-the-reward-function-rx-y-to-evaluate-data-segments-where-x-y-and-are-v/YJrC2BnR4PBz36T9pWuD</loc>
            <lastmod>2026-07-01T02:56:40.101Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-text-simplification-models-performance/YNBoUTCld4gb9Y5h0AFW</loc>
            <lastmod>2025-09-28T17:03:39.701Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-offline-training-approach-for-a-medical-chatbot/YNKg7m04nStZXyuI5hKb</loc>
            <lastmod>2025-10-10T09:10:35.553Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/listwise-loss-formula-from-accumulated-pairwise-comparisons/YO6czkZvGVEtOtxzmjWg</loc>
            <lastmod>2026-05-02T23:23:38.960Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-is-comparing-two-language-models-model-a-is-defined-by-a-set-of-parameters-thetaa-model/YVRsJgLNqZyjGFZgDSLS</loc>
            <lastmod>2025-10-06T11:15:57.132Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-development-strategy-for-an-ai-chatbot/Ya5S5pOAc0VYRQZfxg1v</loc>
            <lastmod>2025-10-08T12:46:49.956Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/filtering-in-self-instruct/YaFaUuCr144jFORDeHK5</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/best-of-n-sampling-bon-sampling/YcLZkbhll5zfMJEZzNXB</loc>
            <lastmod>2026-05-03T15:34:00.141Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-large-language-model-using-a-scoring-function-derived-from-human-preference-dat/YmUINP1xuNdoUAMkdB9U</loc>
            <lastmod>2025-09-26T13:50:31.906Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-the-value-network-target/YnpGTp5E95Q5XW54ubzL</loc>
            <lastmod>2025-10-08T15:23:47.395Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-for-modeling-human-preferences-assigns-a-numerical-reward-score-r-to-a-given-text-response-/YoZjGwZ9muSICv3HH7bv</loc>
            <lastmod>2025-10-04T04:28:20.069Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-reward-system-using-the-homework-analogy/YppK5HQVjMHeMtrQXvB6</loc>
            <lastmod>2025-10-09T00:42:17.095Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-credit-assignment-for-a-policy-update/YpyCrvgidAtrTYHtQ76i</loc>
            <lastmod>2025-10-08T13:40:07.050Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/composite-objective-for-ppo-clip/YqzsUV0zidmP6uaY1clg</loc>
            <lastmod>2025-10-08T21:30:31.063Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/drone-navigation-decision-analysis/YrGh7AExLad41sqQzykb</loc>
            <lastmod>2025-10-06T15:33:37.309Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-is-developing-a-reward-model-to-align-a-large-language-model-with-human-pref/Yt6yyGT8qjfAun5atZ06</loc>
            <lastmod>2025-09-26T04:35:20.563Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-self-instruct-method-for-generating-fine-tuning-data-the-primary-role-of-the-large-language-m/YuifMTk0tTjQVYTXz3yW</loc>
            <lastmod>2025-10-04T09:45:39.989Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/aggregated-reward-as-the-sum-of-segment-based-rewards/YvPoxo9t529szdvQEGZR</loc>
            <lastmod>2026-06-21T02:09:16.033Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-ai-behavior-misalignment/YvdEoepz1KT8c9a55LZO</loc>
            <lastmod>2025-10-09T03:13:42.905Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-a-fine-tuning-task-for-a-business-need/YwkC3in7y5270ysD9Z0n</loc>
            <lastmod>2025-10-04T17:07:04.094Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-a-preference-ranking/YyXEjH3Gvbby1Z5b0MEQ</loc>
            <lastmod>2025-10-04T08:53:12.311Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-reward-system-for-an-ai-tutor/Z32srGfjdQfXbRh8qCxA</loc>
            <lastmod>2025-10-07T08:56:11.317Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-fine-tuning-data-generation-strategies/Z33hefDsrXuDLevd25JZ</loc>
            <lastmod>2025-10-05T18:15:43.621Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/conceptual-reward-model-in-dpos-training-objective/Z6SGiq2spuv70kcLps4W</loc>
            <lastmod>2026-05-03T00:35:23.712Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/principle-of-quality-over-quantity-in-fine-tuning-data/Z71lfQs02pFQZ8bU9ayb</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-diagram-illustrates-a-single-step-in-an-iterative-process-for-enhancing-a-models-input-vectors-in-/Z8JNwVMwC1uLymZonBrU</loc>
            <lastmod>2025-10-04T16:19:59.246Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-unknown-unknowns-of-fine-tuning-strategy/ZBUEwXvegqBH7gPwLzdP</loc>
            <lastmod>2025-10-06T03:06:14.085Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-policy-alignment-with-preference-data/ZDMv31adjaKsvmA7LWRw</loc>
            <lastmod>2026-05-03T00:58:01.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-training-with-a-limited-budget/ZFKBDR63QlZtUX9tmmEU</loc>
            <lastmod>2025-10-10T06:14:32.919Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-fine-tunes-a-pre-trained-language-model-on-a-dataset-consisting-of-examples-every-example-in-/ZHGqhU3gDG9aSZj0Iy4c</loc>
            <lastmod>2025-09-28T17:29:06.495Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/joint-optimization-of-policy-and-value-functions-in-rlhf/ZI8KLCH1Gq3WLNSgcrhe</loc>
            <lastmod>2026-07-03T01:17:11.018Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-language-model-with-a-fixed-set-of-parameters-and-using-a-specific-scoring-method-s-is-perfo/ZLobL3ycpxhoe8bw9WBO</loc>
            <lastmod>2026-06-21T21:52:27.886Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dependency-of-prompting-effectiveness-on-llm-capabilities/ZODahZFEfuF1rZOozeRP</loc>
            <lastmod>2026-04-30T23:04:22.526Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/maximum-likelihood-estimation-mle-as-the-objective-for-supervised-fine-tuning/ZPOLvbiy5owlHUIPEv4d</loc>
            <lastmod>2025-10-08T21:34:11.401Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-misalignment-in-a-customer-support-llm/ZSknVrRyKw8iFsdagA8M</loc>
            <lastmod>2025-10-02T08:20:59.148Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-an-actor-critic-learning-process-an-agent-is-being-trained-it-is-observed-that-the-agent-repeated/ZYYW1xwpZv9TtdU4vHeX</loc>
            <lastmod>2025-09-28T20:57:15.681Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-develops-a-large-language-model-to-summarize-news-articles-to-evaluate-its-performance-the/ZaR6SlC2K80t4dWZhrd7</loc>
            <lastmod>2025-09-26T04:16:13.279Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-surrogate-objective-approximation/ZbrQfUTsqY3twLSdb49j</loc>
            <lastmod>2025-10-08T22:10:16.138Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-asks-a-large-language-model-to-write-a-short-biography-of-a-famous-female-scientist-the-model/Zd9hotW17bM0f2xTSvGE</loc>
            <lastmod>2025-09-26T07:11:08.703Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/explaining-unintended-model-capabilities/ZeVuSSxgKHNSZUAe6U90</loc>
            <lastmod>2025-10-06T03:37:10.093Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-team-is-fine-tuning-a-language-model-to-write-compelling-short-stories-the-model-generates-a-s/ZeWT5dsIrnPSjvJGPL6m</loc>
            <lastmod>2025-10-05T19:38:11.465Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-fine-tuning-an-autoregressive-language-model-on-a-dataset-where-each-example-consists-of-an-inp/ZfTbe1KsGlqohmlIMjOm</loc>
            <lastmod>2025-10-06T16:12:55.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/identifying-the-action-in-llm-fine-tuning/ZfZN8xUFseRBXNNvctVn</loc>
            <lastmod>2025-10-08T14:02:10.200Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-the-score-function-in-policy-updates/Zg1FB5xoyK22ABXfcqBY</loc>
            <lastmod>2025-10-03T05:50:55.188Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-to-score-segments-of-a-generated-text-the-training-objective-is-to-m/Zg1NuuuWUUhTyUCNKD13</loc>
            <lastmod>2025-10-04T03:51:28.340Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prompt-engineering/Zi0op885blvsqAtT1Ss9</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-using-cot-in-a-preference-labeling-prompt/ZiAt6VLnI2Uf2tHTqCSX</loc>
            <lastmod>2026-05-03T01:10:44.252Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-training-feedback-strategy/ZjxtosoqAvm9LDKPhjVM</loc>
            <lastmod>2025-10-02T21:51:37.379Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-common-technique-to-improve-the-stability-of-a-policy-based-learning-algorithm-involves-rewriting-/ZlUzOUTS3NNZhVgKsmmS</loc>
            <lastmod>2025-10-08T20:24:27.425Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-a-transformer-model-is-fine-tuned-to-compress-a-long-context-by-sequentially-processing-text-se/ZmxCN4QuMJ4UZ5G0OIcO</loc>
            <lastmod>2025-10-10T05:46:59.883Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-wants-to-use-an-ai-model-to-get-a-sequence-of-actions-to-repair-a-bicycles-flat-tire/ZnNu0pfOSTCWxI2CE6Gf</loc>
            <lastmod>2025-09-28T14:19:54.742Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-trained-to-learn-human-preferences-by-minimizing-the-following-loss-function-which/ZnQbzWrCWnKDQHRia2xZ</loc>
            <lastmod>2025-10-02T02:23:21.325Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-feedback-as-a-solution-to-human-feedback-limitations/Zo9x58e7DdwGFUdHErKn</loc>
            <lastmod>2026-05-03T01:04:27.421Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-annotation-efficiency-with-active-learning/Zq1ScB2Bwo0mdQnVGXrS</loc>
            <lastmod>2026-05-03T15:05:53.881Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-model-response-alignment/ZrV7KYt0VBdECvjY4lt1</loc>
            <lastmod>2025-09-28T23:24:31.717Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-large-language-model-aligned-with-human-preferences-using-a-reinforcement-lea/ZtGY58tlX5shLMl03Pfy</loc>
            <lastmod>2025-09-26T09:15:58.443Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-fine-tunes-a-general-purpose-pre-trained-language-model-using-a-dataset-of-specif/ZvCcJ1UN0PhOVE0YGpS3</loc>
            <lastmod>2025-10-02T04:04:35.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-data-sourcing-strategy/ZvzdjSBQNltEH864ojUy</loc>
            <lastmod>2025-09-29T01:03:56.681Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-small-unfunded-research-lab-wants-to-fine-tune-a-language-model-for-a-highly-specialized-novel-tas/Zweox1m3S2JwLfamAALF</loc>
            <lastmod>2026-02-08T14:52:43.241Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-reward-model-performance/ZyH0YbJmnax1yun1cSCJ</loc>
            <lastmod>2025-10-08T15:26:02.298Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-customer-left-the-following-review-for-a-restaurant-the-pasta-was-cooked-to-perfection-and-the-sau/a1oBuVdRwcCWDKYyOa0U</loc>
            <lastmod>2025-10-09T02:21:55.233Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-small-efficient-model-is-being-trained-to-emulate-the-behavior-of-a-large-powerful-model-on-a-cate/a3HI7xSkEPyydb16i8az</loc>
            <lastmod>2025-10-03T03:19:51.109Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-wants-to-adapt-a-large-pre-trained-language-model-to-function-as-a-customer-service-chatbo/a5EE4opN5L6jjf0VcoGL</loc>
            <lastmod>2025-09-26T15:41:59.377Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autonomous-robot-vacuum-is-programmed-to-maximize-the-amount-of-floor-space-it-cleans-when-its-op/a60twAT28RGYCZR8sJHj</loc>
            <lastmod>2025-10-10T05:00:50.813Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-strategy-for-a-customer-support-chatbot/a7mf36o2PrBAhNpjm33O</loc>
            <lastmod>2026-02-08T14:24:38.655Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-software-development-team-is-building-an-application-using-a-large-pre-trained-language-model-that/a9rKUCMvMnQmUgJOjgVF</loc>
            <lastmod>2025-09-26T04:45:53.336Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-a-directive-for-task-generation/aC018yptEk5XhgaFM4pA</loc>
            <lastmod>2025-10-10T01:38:21.228Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-provides-a-language-model-with-the-following-prompt-list-the-three-most-common-states-of-matt/aCcwmTsXO0Em8fyJRbDJ</loc>
            <lastmod>2025-09-26T07:53:39.992Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-operates-in-an-environment-where-sequences-of-events-unfold-over-time-the-agents-behavior-i/aD8DhKQPQBGj9aO0MQzI</loc>
            <lastmod>2025-09-26T03:35:50.627Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-powerful-new-language-model-for-summarizing-scientific-papers-lackin/aERuZ0GIFXLDH1h3fqyg</loc>
            <lastmod>2025-09-26T04:31:47.519Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-flawed-alignment-process/aGGPrzzWgEL8kAAuZsxg</loc>
            <lastmod>2025-10-05T19:09:08.173Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-training-a-large-language-model-to-be-a-helpful-assistant-their-process-involv/aGMGwOdfDdCrXoXb8UbV</loc>
            <lastmod>2025-09-28T10:47:53.062Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-ai-assistant-responses/aHwnPDiatWNyB6Noi1S9</loc>
            <lastmod>2025-10-02T03:32:27.723Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-the-expected-reward-objective/aKYfk0kOakc0XsWvrTWw</loc>
            <lastmod>2025-10-04T04:51:06.615Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/basic-policy-gradient-approach/aLoFX76GYIEhcJhQBvv0</loc>
            <lastmod>2026-05-01T16:12:46.188Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-optimization-algorithm-what-is-the-primary-analytical-advantage-of-constructing-the-loca/aLqrL1YzrEifh2SH2mcb</loc>
            <lastmod>2025-09-26T07:00:30.882Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-has-a-large-collection-of-high-quality-desired-outputs-eg-helpful-chatbot-responses-/aMG3IzGeDFPMaDvaAXHk</loc>
            <lastmod>2026-02-08T14:06:55.385Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evolution-of-the-term-alignment-in-nlp/aMJLkdwt3x5Eoz7GQ40Z</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-is-trained-to-clean-a-virtual-room-and-is-rewarded-based-on-how-few-messes-are-visible-to/aOucwvhJM718Wumidkei</loc>
            <lastmod>2025-10-07T08:26:11.741Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-of-absolute-scoring-for-feedback/aP3eSkKjjFpQyQTQhiKj</loc>
            <lastmod>2025-10-06T17:11:18.438Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-models-assumptions-in-a-dynamic-context/aPLpA2MlFOJr9eo5Axz4</loc>
            <lastmod>2025-10-08T14:14:36.527Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-fine-tuning-a-pre-trained-language-model-to-function-as-a-helpful-ass/aPeNPjqc6Kzwc6VUwWOX</loc>
            <lastmod>2026-05-01T00:03:00.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/refining-a-specialized-legal-llm/aR972OyZUlgwriEe3JSF</loc>
            <lastmod>2025-10-02T10:49:59.133Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/startups-chatbot-development-challenge/aRfYytyIb29sBvXMbbGU</loc>
            <lastmod>2026-02-08T14:07:28.225Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-loss-function-behaviors-in-reward-modeling/aUMyrwfvADgV6xputZRk</loc>
            <lastmod>2025-10-06T23:32:32.937Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/mathematical-formulation-of-bon-sampling/aV2SYjEGjQB6NJhXfcsO</loc>
            <lastmod>2026-05-03T15:32:06.567Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-human-annotator-is-given-four-model-generated-responses-a-b-c-d-to-a-prompt-and-ranks-them-in/aWFoWXeAIOkgGVmL9H76</loc>
            <lastmod>2025-09-26T09:00:11.762Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/conceptual-error-in-rl-fine-tuning/aY1iifSa3LgZdAQ8VjLF</loc>
            <lastmod>2025-10-07T15:29:31.297Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/input-formulation-for-segment-based-reward-computation/aYA4galT617yEo7p9MPp</loc>
            <lastmod>2026-05-03T00:07:36.655Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/derivation-of-the-kl-divergence-objective-for-policy-optimization/aasdiiZF0WPohk8gTwKa</loc>
            <lastmod>2026-06-21T20:39:53.842Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/if-a-development-team-trains-two-separate-reward-models-for-the-same-task-using-two-fundamentally-di/adwO48JKzlwWxz3rd9UI</loc>
            <lastmod>2025-10-06T02:07:08.676Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-training-stagnation-in-joint-optimization/aeJf8MShulZiyXNSulrd</loc>
            <lastmod>2025-10-10T05:20:20.503Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agents-training-is-highly-unstable-with-occasional-updates-causing-a-sudden/agpiQFJfbKYjsApxRftv</loc>
            <lastmod>2025-10-02T11:43:35.745Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-has-a-large-pre-existing-dataset-of-input-output-pairs-for-a-specific-text-based-task-eg/ahMxhuJQH2yk9ixrLyfB</loc>
            <lastmod>2025-10-03T02:35:06.564Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/typical-sequence-of-llm-alignment-methods/aiXM4mOXon2frFu30UUB</loc>
            <lastmod>2026-04-30T23:33:48.347Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-a-policy-update-calculation/ajPlo871qDRoOKe1on0B</loc>
            <lastmod>2026-05-10T01:37:25.473Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-rejection-sampling-and-rlhf/ajcYAFRV1KAbKsHXJAli</loc>
            <lastmod>2026-05-03T15:37:05.407Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-agent-is-being-trained-to-play-a-complex-board-game-the-agent-only-receives-a-reward-signal-at/akcsmbyYNHeMqY0bdvvJ</loc>
            <lastmod>2025-09-29T00:40:07.500Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-models-as-the-basis-for-value-functions/aljpY3ivhhh6JLHrHyjA</loc>
            <lastmod>2026-05-01T16:53:43.814Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-generating-a-response-sequence-y-given-an-input-context-x-the-model-generates-th/amVwAybQJNK0GWQDpHEu</loc>
            <lastmod>2025-09-28T22:54:19.733Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generalization-as-an-outcome-of-sft/aoMefaRfSdWdEu1ZDVbk</loc>
            <lastmod>2025-10-06T19:00:05.995Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/cascading-inference/aobjvf43vdsRkNcXgPjN</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/handling-labeler-disagreement-in-reward-modeling/aoh1BZXvvFPzqY8M6r6C</loc>
            <lastmod>2025-10-09T00:24:25.584Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/strategies-for-segmenting-output-sequences-in-reward-modeling/apxr8RpN1gLKYKeJHtq3</loc>
            <lastmod>2026-05-03T00:15:45.837Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-fine-tuning-strategy-for-llms/aqltQEq1ZqJ0m7RyMajf</loc>
            <lastmod>2026-02-08T14:11:54.767Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-developing-a-model-to-automatically-simplify-technical-documentation-for-a-gener/atUjvrndaXPuBOBsy77T</loc>
            <lastmod>2025-10-06T17:44:17.596Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-an-alignment-strategy/ath2jV79dOPHKPf7VFa1</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-data-generation-strategy-for-model-specialization/atndubFN00h17vcuQ6Jn</loc>
            <lastmod>2025-10-06T11:24:46.803Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-ai-assistant-prompts/attSIVfRijKI8mxrk2XA</loc>
            <lastmod>2025-10-02T19:21:47.412Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-lead-an-internal-review-board-deciding-whether/auDhKIHX5dKQLmBwbX5n</loc>
            <lastmod>2026-02-06T18:26:27.115Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-creating-a-single-data-sample-to-fine-tune-a-chatbot-arrange-the-following-components/auva3hf65Fh60uOvhapT</loc>
            <lastmod>2026-02-08T14:02:11.424Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-using-a-large-language-model-to-automatically-generate-a-dataset-of-progra/avsJ5TNAozHTtRoNUsl9</loc>
            <lastmod>2025-10-06T21:02:49.579Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-is-pre-training-a-text-model-for-an-inte/ay6Fa1RDIzK7rWSUSvmN</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/cumulative-reward-of-a-trajectory/azALYyYxujwycitKZM6M</loc>
            <lastmod>2026-05-01T16:07:30.768Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-model-output-against-task-requirements/azr6wt9SoaS39uBAvsPd</loc>
            <lastmod>2025-10-09T03:54:55.112Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/process-based-approaches-for-llm-fine-tuning/b1oDolLoFTfRxt6OFNbl</loc>
            <lastmod>2026-05-03T15:22:42.322Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-training-a-soft-prompt-to-act-as-a-compressed-version-of-a-longer-context-the-primary-optimizat/b1uiQmJESGuelwt53bGV</loc>
            <lastmod>2025-10-02T06:03:58.350Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/preference-notation-in-human-feedback/b25KivwfJzX8IIeUyuEw</loc>
            <lastmod>2026-06-30T17:00:36.654Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-end-of-sequence-rewards-in-rlhf/b4Yc5Mj7epsof6izGx64</loc>
            <lastmod>2026-05-02T23:57:52.388Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-is-launching-two-separate-data-annotation-projects-in-project-alpha-annotato/b549fwOen6jYxHA8e9yX</loc>
            <lastmod>2025-10-02T05:13:53.992Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/differentiating-training-objectives-in-language-models/b59Hj1EmOm8nCrR9oV3D</loc>
            <lastmod>2025-10-05T23:49:35.530Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-developing-a-sophisticated-ai-assistant-to-generate-creative-and-poetic-marketing-sloga/b5FgMNT9VDwhSnxuIxkh</loc>
            <lastmod>2025-10-07T10:51:46.804Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-weak-model-self-instruct-data-strategy-for-instruction-fine-tuning-without-regressions/b6d9fL3BIXOZbeFv9nL7</loc>
            <lastmod>2026-02-08T13:57:02.474Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-of-policy-gradients-non-differentiable-reward-functions/b6ughTopPtaOwnwRsjzM</loc>
            <lastmod>2026-05-01T16:24:41.354Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/youre-running-an-rlhf-fine-tuning-job-for-an-inte/bA5gClmX1fpZBtZQKHkb</loc>
            <lastmod>2026-02-06T17:53:47.521Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-constrained-prompt-for-simplification/bEI1bZmFLbGjlvFrVdET</loc>
            <lastmod>2025-10-07T10:52:26.304Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-fine-tuning-a-language-model-with-reinforcement-learning-the-optimization-objectiv/bFdTeAu53Z1YdWR4riB4</loc>
            <lastmod>2025-10-03T04:23:43.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-fine-tunes-a-large-pre-trained-language-model-using-a-high-quality-dataset-of-exa/bGJxLf1vVQLYd7III4Jf</loc>
            <lastmod>2025-10-01T19:14:57.625Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/curriculum-learning/bH1uc9xPzOJGIjbV0miC</loc>
            <lastmod>2026-05-16T12:37:44.910Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-low-diversity-in-a-generated-dataset/bHhxzfx5HRzs8rrjvoCW</loc>
            <lastmod>2025-09-28T23:37:22.717Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-structured-fine-tuning-sample-for-machine-translation/bKkBtvH7MAEIU5uJWu0h</loc>
            <lastmod>2026-05-01T00:58:57.627Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-bayesian-model-averaging-to-reward-models/bKxgDb069IGV1kutDLaE</loc>
            <lastmod>2025-10-03T01:11:41.241Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/heuristics-based-data-filtering-for-fine-tuning/bMOFnbhguvybh23dcWYC</loc>
            <lastmod>2026-05-12T16:52:29.629Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/inevitable-errors-and-biases-in-synthetic-fine-tuning-data/bMVfLRhnNFjgRPFBtnNt</loc>
            <lastmod>2025-10-05T14:53:42.541Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-a-product-review/bMvhebc6phZZSTtTS29W</loc>
            <lastmod>2025-10-03T18:55:19.012Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-iterative-process-of-training-a-language-model-using-human-feedback-the-component-respons/bNQoxuFcgVwGbuxr1zdT</loc>
            <lastmod>2025-10-07T10:10:25.935Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-interplay-between-model-advancement-and-interaction-methods/bNUZfxepMqQvWyMepNHr</loc>
            <lastmod>2025-09-28T13:58:42.872Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-language-model-to-generate-helpful-and-coherent-paragraphs-they-are-comparing-t/bQ8RwuqU7wKbEBRnncvN</loc>
            <lastmod>2025-09-26T01:52:28.013Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-evaluating-a-generated-output-that-has-been-divided-into-parts-the-notation-barmat/bRjIGEMCdK1WQsEgnSSc</loc>
            <lastmod>2025-10-08T21:05:21.117Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-training-diagnosis/bX4qhgAFDgp3Qcvv5OlK</loc>
            <lastmod>2025-10-04T04:44:33.890Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-fine-tuning-training-objective/bXhNvbDjSfpkxGYJqkmF</loc>
            <lastmod>2026-05-01T00:03:00.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-llm-alignment-contributions/bXj3Me4nIh1jpu29axQr</loc>
            <lastmod>2025-10-02T09:36:17.522Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/constructing-a-fine-tuning-sample/bXwc7xh5eW0YlTE09gjw</loc>
            <lastmod>2025-10-09T01:28:07.533Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-prompt-for-evaluating-customer-service-responses/bYgvX5IQK1Lt0sTtn5fV</loc>
            <lastmod>2026-05-03T01:02:55.445Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-reinforcement-learning-using-the-one-step-advantage-estimate-calculated-as-r-vst-vst-to-update-an/baIWVJ4ZyRFcVpzd8OkL</loc>
            <lastmod>2026-05-17T20:53:15.841Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-training-methodology-with-its-primary-optimization-objective/bcLO1PzuJ9DbeezhCGys</loc>
            <lastmod>2025-10-10T07:47:06.342Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-clinical-inquiry-about-symptom-duration/bcrpVpRfbPrK1LpOKeNX</loc>
            <lastmod>2025-10-05T13:29:27.874Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-interacts-with-a-large-language-model-that-has-only-undergone-its-initial-training-phase-on-a/bdxymrhu9Tnn8IIH04nm</loc>
            <lastmod>2025-09-28T23:28:12.030Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-small-research-lab-with-a-limited-budget-aims-to-fine-tune-a-language-model-for-a-specialized-task/blJXHagisSM1enTvcL0N</loc>
            <lastmod>2025-10-05T22:01:03.372Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-derivation-of-the-preference-probability-in-terms-of-policy-ratios-involves-several-key-steps-ar/blplN2idNMPk98Tg6SLl</loc>
            <lastmod>2025-10-08T23:49:45.744Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sft-as-a-post-training-phase/blv69kP0kB9MBMwDkZx9</loc>
            <lastmod>2025-10-06T19:27:21.495Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-unified-performance-metric-for-ai/boA7bzz3rZoMR5omxEoX</loc>
            <lastmod>2026-02-08T14:18:40.732Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/correcting-a-reward-models-preference-error/boRQ7RdoK7ublmdIMoAZ</loc>
            <lastmod>2025-09-28T23:02:37.374Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agents-policy-is-defined-by-a-set-of-parameters-theta-after-extensive-train/bpNnhU2JygHOA03kxJiT</loc>
            <lastmod>2025-10-03T20:08:03.936Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/direct-preference-optimization-dpo-training-process/bpZlWVrKhFKzCiYxvUnD</loc>
            <lastmod>2026-06-26T22:34:07.196Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/bound-function-for-policy-probability-ratio/bpkUqNlYOtJysZd0nTZu</loc>
            <lastmod>2026-06-27T19:05:55.660Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-given-the-instruction-from-the-following-text-extract-the-total-revenue-net-inco/bsNCEBoojki2x6T5u8Hk</loc>
            <lastmod>2026-06-27T17:54:58.410Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/derivation-of-the-policy-gradient-objective-function/btt1i1TuPawh3zmMadMA</loc>
            <lastmod>2026-05-01T16:14:06.839Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-adapts-a-large-pre-existing-language-model-to-function-as-a-specialized-chatbot-f/buKQeVMNR8X41FpwxPYU</loc>
            <lastmod>2025-09-26T08:10:23.825Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/log-probability-based-reward-for-reasoning-paths/bvgHg3kiagLb50nMv1Tt</loc>
            <lastmod>2026-05-03T15:09:22.186Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-training-a-multi-round-dialogue-model-by-concatenating-the-entire-conversation-into-a-single-se/bvm1y8iqKVzpm1yD5yh7</loc>
            <lastmod>2025-10-10T07:27:33.642Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-outcome-based-and-process-based-evaluations-of-math-responses/bxExbrqhFKFH08U0WmUB</loc>
            <lastmod>2026-05-03T15:02:13.478Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-seed-task-suitability/c0n1zS5cynilNcTSnNGS</loc>
            <lastmod>2025-10-05T19:02:52.202Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-observes-that-several-top-performing-publicly-released-large-language-models-have-in/c1UU5qhhNmzTayfhfBMr</loc>
            <lastmod>2025-10-03T02:33:39.612Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agents-performance-is-being-evaluated-using-a-set-of-recorded-experiences-trajectories-that-were-/c2TdfEMrRdCVHDXv3zIz</loc>
            <lastmod>2025-09-28T14:48:32.807Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/shorthand-notation-for-a-multiset-of-identical-elements/c2UXQCsiLkUsUC2GRctt</loc>
            <lastmod>2026-06-26T22:35:46.344Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-data-efficient-fine-tuning-strategy/c2ZQYHkNVfLH21v0fhcY</loc>
            <lastmod>2025-10-02T03:48:06.474Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/plackett-luce-model-for-listwise-ranking/c32rlLG9OKN9dCygAZ7t</loc>
            <lastmod>2026-05-02T23:30:28.172Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-provides-the-same-simple-one-sentence-instruction-summarize-the-attached-text-to-two-dif/c53a8oujJQMs2ZeC7mny</loc>
            <lastmod>2025-09-29T01:57:11.624Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ethical-challenges-in-llm-alignment/c68TshQm7koFKcBW33tN</loc>
            <lastmod>2025-10-06T19:32:31.230Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-preparing-a-dataset-to-fine-tune-a-language-model-for-a-machine-translation-task-arrange-the/c6BaEbMMvVIgebdpYvHY</loc>
            <lastmod>2025-10-05T20:09:06.073Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reduced-necessity-of-fine-tuning-for-generalization-with-extensive-pre-training/c6IyGyXaGekUHItHrFfu</loc>
            <lastmod>2026-05-01T14:38:23.165Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-characteristic-to-the-type-of-prompt-it-best-describes/c9PmJaH0dsNrtrFdiN82</loc>
            <lastmod>2025-10-05T23:22:48.618Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/value-based-reward-shaping-formula/c9cTK7xYF8ZaSlxGvhbb</loc>
            <lastmod>2026-07-01T09:19:36.085Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-the-llm-prediction-formula/cCEBhp8Pn0urcJQA6nnO</loc>
            <lastmod>2026-07-03T23:21:45.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-model-disagreement-in-data-curation/cCnL60YrpUZCdrFTIIln</loc>
            <lastmod>2025-10-10T06:23:14.943Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/loss-masking-via-forward-and-backward-passes-in-sft/cEaCFNzGPN8Wj9EB25qM</loc>
            <lastmod>2026-05-01T00:03:00.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/causality-constraint-in-reinforcement-learning/cEoUyID9XkfWdY9vzaJ7</loc>
            <lastmod>2026-05-10T01:37:28.742Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-the-role-of-synthetic-data-in-llm-fine-tuning/cEvNq2PvnPbqZj8iXCyy</loc>
            <lastmod>2025-10-01T19:33:54.795Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/importance-of-variability-in-pairwise-preference-data/cG7MiQghmOKRkMlW976M</loc>
            <lastmod>2026-05-03T01:11:22.603Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fine-tuning-llms-with-labeled-data/cIitlRclsBjolbp4CDvi</loc>
            <lastmod>2026-04-30T23:26:31.880Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-synthetic-data-generation-strategy/cKcuh2sAPyIfWmKzSfR5</loc>
            <lastmod>2025-10-10T07:51:16.277Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-llms-response-to-a-sensitive-request/cKr5eiDjCxk6Z6jDGkRE</loc>
            <lastmod>2026-04-29T04:19:20.016Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-candidate-text-sequences/cONYBPUtd9b42U7HoQDI</loc>
            <lastmod>2025-10-08T20:12:37.104Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-policy-gradient-methods-the-gradient-of-the-log-probability-of-a-trajectory-is-initially-expresse/cOowRKMBYJ4qhNF43gWy</loc>
            <lastmod>2025-09-26T04:50:23.865Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-system-that-generates-a-sequence-of-k-items-let-each-for-i-from-to-k-represent-a-summary/cU6BDgrUxvc9F8fUbL5H</loc>
            <lastmod>2025-09-28T12:06:50.565Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/likelihood-and-cross-entropy-as-data-filtering-criteria/caQ0pJtz7CXt1pG2vVHQ</loc>
            <lastmod>2025-10-06T19:42:15.411Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/basic-ac-formulation-for-llms/cbMlu5ZesjK6xWHzpayz</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-and-refine-a-summarization-prompt/cdQTT8bmpuHo9ysWmtYZ</loc>
            <lastmod>2025-10-05T18:09:47.983Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fundamental-approaches-to-llm-alignment/cfkL6JMR4jyvv7ngl3my</loc>
            <lastmod>2026-05-03T15:42:35.822Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-iterative-process-of-refining-a-language-model-using-feedback-different-components-of-the-mod/cfw9MRjuXueT1UGAm1Yw</loc>
            <lastmod>2025-10-10T04:30:55.181Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-fixed-model-assumption-in-a-preference-based-optimization-framework-implies-that-the-process-adj/cgUs66rgWXa8m2bybBAl</loc>
            <lastmod>2025-10-06T20:34:07.287Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-small-models-for-pre-training-or-fine-tuning/cgroRVuqIIcw5TxTXjy8</loc>
            <lastmod>2026-05-01T15:08:14.319Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/pre-train-then-align-method-for-llm-development/ciPQ2CxeeBke51hG28sT</loc>
            <lastmod>2026-04-30T23:33:48.347Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-a-bounding-constraint-on-probability-ratios/ckcRJFbhFw41zLnaWKOo</loc>
            <lastmod>2025-10-08T21:43:50.594Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/youre-designing-an-internal-llm-feature-that-moni/clUf5AG7AX27OzqxyCz3</loc>
            <lastmod>2026-02-06T18:32:16.479Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-reward-model-using-a-loss-function-that-only-considers-the-relative-ranking-bet/clzpS0AFJAaRBprPi3ok</loc>
            <lastmod>2025-09-28T13:00:41.318Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-needs-to-generate-a-perfectly-balanced-synthetic-dataset-for-a-sentiment/cmmgc5JeFNjVKxqGcyHo</loc>
            <lastmod>2025-10-10T04:02:15.376Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/unbiased-nature-of-policy-gradient-with-baseline/coj8fmf3aaMSEDjUdU2k</loc>
            <lastmod>2025-10-06T19:46:47.819Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autoregressive-language-model-is-being-trained-on-a-single-data-instance-the-model-is-provided-wi/cqKQ2PZSgYcbNnfBLEvW</loc>
            <lastmod>2025-10-05T13:22:04.303Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/component-analysis-of-the-combined-reward-formula/cqLB917kbi3FuIjMrC09</loc>
            <lastmod>2025-10-08T16:14:31.785Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-team-is-building-a-general-purpose-chatbot-they-train-two-different-models-on-a-large-dataset-/cqsxrnj4dmcUbIOZ0fpq</loc>
            <lastmod>2026-02-08T14:18:16.944Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-llm-instruction-adherence/crV5lTSRSGRH51Ky086F</loc>
            <lastmod>2025-10-02T08:41:26.617Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-a-dialogue-model-training-loop/ctBF42osIVpYBPLGOay3</loc>
            <lastmod>2025-10-04T05:25:13.558Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/scaling-feedback-for-an-ai-model/cwyWM3zswpUBdnXQfj20</loc>
            <lastmod>2025-09-28T18:53:03.213Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-a-reinforcement-learning-update-for-a-language-model-the-value-function-is-trained-to-predict/cxEWUfPvVpH8I4dxGy78</loc>
            <lastmod>2025-09-29T00:09:28.410Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-is-interacting-with-a-chatbot-designed-to-help-with-medical-queries-arrange-the-following-con/cxOseZ2gd2dazYMDjlDk</loc>
            <lastmod>2025-10-04T06:08:00.474Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-safety/cxWFH2YCuT9xdVLIxz5V</loc>
            <lastmod>2026-05-03T16:04:11.253Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-team-fine-tunes-a-language-model-exclusively-on-a-dataset-for-a-single-task-translating-englis/cxelA0URvMJVJXLNrkH9</loc>
            <lastmod>2026-02-08T14:18:08.337Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-text-summarization-prompt/cxyLU3ucIxmy51RvHVDK</loc>
            <lastmod>2025-10-10T01:01:54.691Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-wants-to-establish-the-upper-bound-performance-benchmark-for-their-new-powerful-lang/cyC3a9HapEWlGC9ct0VV</loc>
            <lastmod>2025-09-26T10:11:59.074Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-user-queries-for-a-specialized-ai/cyLHloIQR5b6M1lxynr7</loc>
            <lastmod>2025-10-04T16:10:28.531Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-fine-tuning-strategies-scaled-diversity-vs-efficient-adaptation/cyeISABmD90mh7pGVIuj</loc>
            <lastmod>2026-05-01T14:39:10.609Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-role-of-a-loss-function-in-reward-model-training/d162fGx2GijB4iKJnJXj</loc>
            <lastmod>2025-10-06T15:19:52.778Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/constructing-a-summarization-prompt/d4imtvZxooiodHmtEZyK</loc>
            <lastmod>2025-10-09T02:47:52.385Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-with-the-objective-of-modeling-the-joint-probability-of-an-input-s/d6LL9JrhrmpeGtrFVKo8</loc>
            <lastmod>2025-10-01T19:11:55.987Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/role-of-the-critic-in-advantage-function-calculation/dEgPzhhFi9vvwf761n2B</loc>
            <lastmod>2026-05-01T16:46:15.582Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-baseline-for-preference-alignment/dF3k0KUzsmaRLPkaNbUW</loc>
            <lastmod>2025-10-03T16:21:52.279Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/chatbot-performance-analysis/dGmuRecF9tVzMjLdfe0e</loc>
            <lastmod>2026-06-29T21:01:57.589Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/average-value-notation-for-a-specific-group-baryk/dGz53T3lbK0pS9OvpH47</loc>
            <lastmod>2026-07-04T00:11:58.027Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-issues-in-llm-reinforcement-learning/dH0xja3HB63txtkTIYuB</loc>
            <lastmod>2025-10-01T21:23:37.231Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-final-stage-of-training-a-language-model-with-feedback-a-policy-and-a-value-function-are-opti/dKDESzt0dW0OKYHlftgE</loc>
            <lastmod>2025-10-05T20:25:20.018Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-llm-performance-on-a-reasoning-task/dKKBcN0vZ2QIL5f3Vkkb</loc>
            <lastmod>2025-10-01T19:52:40.391Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-training-process-where-a-small-model-first-selects-a-subset-of-data-from-a-large-initial-/dLFXgxyQdSs5ENPZgN6Q</loc>
            <lastmod>2025-10-06T11:17:31.222Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-aligned-using-feedback-from-human-preferences-a-separate-model-is-first-tr/dMcjCcL6dx8BHvawEQ6v</loc>
            <lastmod>2025-09-26T07:26:14.232Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/combining-human-and-ai-feedback-for-llm-training/dMsT30RGNfLD3qLNEKNR</loc>
            <lastmod>2026-05-03T01:12:01.825Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-and-explaining-a-peft-strategy-under-deployment-constraints/dO7coVghoszUSu1dNTDF</loc>
            <lastmod>2026-02-06T18:00:59.399Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-has-created-a-long-and-convoluted-prompt-for-a-text-to-image-model-which-is-yielding-inc/dO9h8LXcHNKLauvFdgLp</loc>
            <lastmod>2025-10-02T17:55:33.226Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-alignment-in-robotics/dPtD1VD6UlDpRGlsRnzf</loc>
            <lastmod>2026-05-03T15:45:51.750Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/hinge-loss-formula-for-segment-based-reward-model-training/dUHsUpFnlHIDWvITR5Dg</loc>
            <lastmod>2026-05-03T00:15:20.916Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-data-generation-strategy-for-a-general-purpose-llm/dUJ4aY5pt6VD4hBsCfRg</loc>
            <lastmod>2026-02-08T14:52:51.854Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-the-reinforcement-learning-loss-function/dXMNk9qdhOIHmL5BY64h</loc>
            <lastmod>2025-10-02T22:25:50.125Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-wants-to-expand-a-small-manually-created-set-of-instruction-following-data-in/dXYAuQpoOc30H4jf1J30</loc>
            <lastmod>2025-09-29T00:56:22.028Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-aims-to-align-a-large-language-model-with-the-complex-value-of-being-helpful-thei/dXgqFTnaTZcKYBG2Ef9y</loc>
            <lastmod>2025-10-05T16:49:56.917Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-context-dependent-mathematical-notation/dYREbLqoGmuD7FO52ggL</loc>
            <lastmod>2025-10-02T02:51:07.822Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-implementing-a-reward-model-by-adapting-a-pre-trained-language-model-after-feeding-a-/dYtxlHS3PsQ5NOX2GOY1</loc>
            <lastmod>2025-09-29T00:26:11.427Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-ai-content-generation-project/dZcExdoIN16LprlKuyOB</loc>
            <lastmod>2025-10-06T15:55:00.781Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-derivation-of-the-policy-performance-gradient-a-key-step-transforms-the-expression-pr-r-i/daVJakZGrhltaGfMhfgr</loc>
            <lastmod>2025-09-28T20:03:36.080Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/next-word-prediction-model/dbAkHL85wxtPnjgomchy</loc>
            <lastmod>2025-09-26T14:48:19.368Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/overoptimization-problem-in-reward-modeling-reward-hacking-or-reward-gaming/dc35cmwo66WiVLKxk7cX</loc>
            <lastmod>2026-02-06T00:02:46.926Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-integrated-energy-companys-quarterly-earnings-report-reveals-two-key-data-points-a-decline-in-rev/ddqGXYUGFrydktDyTawh</loc>
            <lastmod>2025-10-05T20:45:39.630Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/aligning-large-language-models-with-human-values/deU4X1wW7IHP7xnP3DNv</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/empirical-reward-model-loss-formula-using-bradley-terry-model/ded3OYEnnkgYRy5HNr7n</loc>
            <lastmod>2026-06-29T04:38:16.686Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-filtering-for-a-specialized-language-model/dewlej1Bfrc6q6dymovL</loc>
            <lastmod>2025-09-28T20:27:03.828Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-knowledge-transfer-effectiveness/dgCnFEcMe3haSUbPfu2P</loc>
            <lastmod>2025-10-03T05:46:35.192Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-small-model-improvement/dgrAJQVAjUY88c64dxqi</loc>
            <lastmod>2025-10-10T05:23:41.201Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sequence-of-elements-in-angle-brackets-notation/dhKPmGRuYamEhrPdDxkb</loc>
            <lastmod>2026-06-30T09:58:56.878Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-fixed-ai-constitution/djfy9n54jWDOYPgZyLvX</loc>
            <lastmod>2025-10-07T10:59:28.802Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-data-distribution-on-reward-model-training/dliHc81BUo7LU7OjWbzj</loc>
            <lastmod>2025-10-07T04:41:35.290Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/strategic-ai-development-for-a-startup/dnBklwNjc2av5uJmfaZi</loc>
            <lastmod>2026-02-08T14:08:47.226Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/justifying-the-ensemble-approach-for-reward-models/dpWS9R8pCA0fkJ5rKX8y</loc>
            <lastmod>2025-10-06T22:24:37.405Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-process-for-training-a-language-model-a-value-model-is-used-to-estimate-/duk4aKiqPoo3PCZtBsuv</loc>
            <lastmod>2025-10-07T04:31:29.329Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-implementing-a-system-that-combines-outputs-from-an-ensemble-of-different-reward/dvIXIGgdnleW3CjIeOHS</loc>
            <lastmod>2025-10-06T16:51:13.119Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-generated-paragraph-is-divided-into-distinct-sentences-for-a-more-detailed-evaluation-if-the-c/dxP0qbkG0BMOQ9Sc3jFL</loc>
            <lastmod>2025-09-28T16:17:24.284Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-the-training-objective/e09ZV0fUZkgPzT8cWrvx</loc>
            <lastmod>2026-04-29T04:19:17.597Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critiquing-a-document-similarity-system/e4Fpe2rmRCquyRpMmYdP</loc>
            <lastmod>2025-10-06T14:04:38.297Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/shift-in-the-relevance-of-ai-alignment/e6fuJcl78ouWbUpaP42C</loc>
            <lastmod>2026-05-03T15:45:26.720Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-llms-instruction-following-performance/e6hu4tcFnqyht05w5Ycx</loc>
            <lastmod>2025-10-05T15:21:01.865Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-using-an-objective-function-that-balances-a-reward-based-component/e8UhqckrOQL7WDQZ9gVe</loc>
            <lastmod>2025-09-26T02:55:35.632Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-a-dialogue-sequence-representation/e8huDNWFdCZuO6BlcMbI</loc>
            <lastmod>2025-10-07T15:17:16.309Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-fine-tuning-a-language-model-to-be-a-highly-accurate-and-safe-legal-assistant-the/eA1Jqg74APvMhReVX9zn</loc>
            <lastmod>2026-02-08T14:24:43.983Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/notation-for-a-list-of-outputs-in-ranking/eEt7jpt6tAzUxLxcprMs</loc>
            <lastmod>2026-05-02T23:30:09.379Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-scenario-an-agent-is-in-a-particular-state-and-has-two-possible-actions-/eGbe2YLjfaeG2EpmqSh2</loc>
            <lastmod>2025-09-26T11:49:45.383Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/feedback-strategy-for-a-high-volume-chatbot/eI048sslkRs1iCYGYRxy</loc>
            <lastmod>2025-10-07T00:18:15.018Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-data-sourcing-strategy-for-a-niche-chatbot/eMiR9zwfmgzGwjDnUOZX</loc>
            <lastmod>2025-10-06T03:55:51.173Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/risk-of-overfitting-and-catastrophic-forgetting-in-sft/eQ9fhLFSNGZuCKY2Pip0</loc>
            <lastmod>2026-05-01T00:48:47.348Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-flawed-fine-tuning-dataset/eRwc7VUquuLeNibOnmIN</loc>
            <lastmod>2025-10-09T01:23:13.986Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-context-loss-in-a-dialogue-model/eSaf9pR44kkEaSlMXjTh</loc>
            <lastmod>2025-10-04T05:16:15.571Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-a-prompt/eSqUcu9n5lYOd1ND41uR</loc>
            <lastmod>2025-10-07T10:11:07.201Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-preference-model-performance-with-listwise-loss/eTBMJoABPtjaGv5kFs78</loc>
            <lastmod>2025-10-06T03:59:46.485Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-fine-tuned-on-a-dataset-of-customer-support-chat-logs-to-improve-its-abili/eTbNIK9p6yKBxtqAqnZD</loc>
            <lastmod>2025-09-28T12:09:44.575Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-learning-in-rlhf/eUyO4gVcRodObsqTTTw5</loc>
            <lastmod>2026-05-03T00:34:16.782Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-model-training-setup-a-smaller-student-model-is-trained-to-mimic-the-output-probability-distrib/eVBwAf9rpwrjLpkKFF7s</loc>
            <lastmod>2025-09-28T14:14:14.692Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-preference-notation/eY3pZYKZ9yXHLNq6bCgj</loc>
            <lastmod>2025-10-08T21:38:55.075Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/parameterization-of-the-llm-policy/ecT5RmSoCfCHBYC96fW0</loc>
            <lastmod>2025-10-08T12:56:28.086Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/implicit-instruction-following-via-response-only-fine-tuning/eckLR4RU8hWRAqobHVZN</loc>
            <lastmod>2026-05-01T10:36:01.363Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-data-generation-methods-for-instruction-fine-tuning/edNtgRD0xLiLGylNn1TF</loc>
            <lastmod>2025-10-06T02:11:16.828Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-a-shaped-reward/efr8Zxf9eELHnyEKK5Sv</loc>
            <lastmod>2025-09-28T20:15:05.074Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-corporate-earnings-reports-in-the-energy-sector/ejIvPaMRSpjXaJkkRQmz</loc>
            <lastmod>2025-10-10T05:40:58.261Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-sentiment-analysis-output/ekhEnV2W2Pw5m7ESGIkK</loc>
            <lastmod>2025-10-09T03:05:04.054Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-prompt-tuning-vs-prefix-fine-tuning-by-reasoning-from-where-soft-prompts-enter-the-transfo/emzzpQrZKornWbHjOA4X</loc>
            <lastmod>2026-02-06T18:01:31.619Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-team-is-preparing-a-dataset-for-training-a-reward-model-they-present-pairs-of-model-generated-/enUBMs6ZDvHRlABrgFdK</loc>
            <lastmod>2026-05-01T18:08:34.830Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/pgr-calculation-scenario/eqU7dBZCAI44pOhl4LfI</loc>
            <lastmod>2025-10-02T02:52:35.110Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/self-instruct-for-generating-fine-tuning-data/eszC9Lkh8bl6K7Op4cBg</loc>
            <lastmod>2026-05-01T01:14:22.678Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/equivalence-of-the-surrogate-objective-and-the-on-policy-objective/euIC8hMEa1t4ypch36Ea</loc>
            <lastmod>2026-06-29T07:14:54.434Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/probabilistic-objective-of-supervised-fine-tuning/ew5R8ov457PY95l4ElOg</loc>
            <lastmod>2026-06-25T06:02:03.911Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/final-memory-state-as-a-comprehensive-context-representation/ewaEpLumEg81tUaaV6z6</loc>
            <lastmod>2025-10-06T20:21:14.730Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-novel-chatbot-training-method/ex3KlBor5ibkfiOtzzAe</loc>
            <lastmod>2026-02-08T14:06:51.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpretation-and-empirical-results-of-performance-gap-recovered/exKnm2HNhzvQh9qirTMW</loc>
            <lastmod>2026-05-01T14:54:26.143Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/transforming-sparse-rewards-into-dense-supervision-signals/exz0guQOUzRpmScbPPyI</loc>
            <lastmod>2026-05-02T23:57:39.837Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-is-investigating-the-relationship-between-two-variables-and-creates-a-scatter-plot-to-v/eyedAjgCLtFDp3V3GCee</loc>
            <lastmod>2025-09-28T14:14:54.972Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-uses-a-large-pre-trained-language-model-to-generate-summaries-of-news-articles-to/f07iJhDEJVBimS18umxx</loc>
            <lastmod>2025-09-28T13:43:04.194Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-fine-tuning-of-a-language-model-using-a-reward-signal-a-team-observes-that-the-models-out/f1yx16rFx6ad8tkBazfe</loc>
            <lastmod>2025-09-29T12:01:15.944Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-between-prompt-tuning-and-prefix-fine-tuning-for-a-latency-critical-multi-task-llm-service/f3OViYT8divdkVjRqOoX</loc>
            <lastmod>2026-02-06T18:02:09.365Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-a-flawed-reward-shaping-implementation/f7PxBmaWnYiRAk9kFhvT</loc>
            <lastmod>2025-09-26T15:16:13.568Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critic-network-training-target/f9Y7bE9VrDJsvTAwRNnr</loc>
            <lastmod>2025-10-02T20:54:25.657Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-model-to-simplify-complex-medical-jargon-into-plain-language-for-patients-the/fBjnnTrGYRrhp4zLGBuo</loc>
            <lastmod>2025-10-05T17:28:02.576Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-process-of-fine-tuning-a-language-model-using-feedback-the-problem-is-often-framed-using-conc/fCKlajXcLVX7UsFwiztf</loc>
            <lastmod>2025-10-07T12:06:13.742Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/off-policy-performance-estimation/fCifMGBTvlm6NlcWmDF7</loc>
            <lastmod>2025-10-04T02:03:09.193Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formulating-a-domain-specific-query/fFUptvgJqfNdQrt0pVuV</loc>
            <lastmod>2025-10-10T01:41:40.611Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-reward-model-notation/fGGo63Q9Nxq3uLsmfhiT</loc>
            <lastmod>2025-10-08T16:28:22.423Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-prompt-template-for-data-generation/fJ1Q8J8HKSP1bu5fH7CN</loc>
            <lastmod>2025-10-09T00:53:04.646Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-policy-gradient-training/fKT5JYrhVzFjqnKlnFHO</loc>
            <lastmod>2025-10-08T14:45:59.599Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-is-being-trained-to-generate-a-multi-paragraph-summary-of-a-long-document-the-ai-writes-the-su/fNMMTmvpre0KegJM8UtJ</loc>
            <lastmod>2025-09-26T06:24:57.211Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/biased-predictions-in-llm-based-synthetic-data-generation/fONcX979BNCXChT8JcB0</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-policy-update-mechanism-uses-a-function-to-adjust-the-policy-probability-ratio-defined-as-minratio/fPfBCRLkPcgJod8g3xae</loc>
            <lastmod>2025-10-08T21:15:18.629Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/challenges-of-manual-prompt-design/fTlC0BECixXKJ4pZmvXF</loc>
            <lastmod>2026-05-01T01:04:18.993Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-language-model-where-the-training-objective-is-to-adjust-the-models-parame/fU6m7LhkxQJqjHfNCcRh</loc>
            <lastmod>2025-09-26T08:04:00.629Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-clipping-mechanism-based-on-advantage-sign/fYsbClPGNTMpSmjkeZbZ</loc>
            <lastmod>2025-10-08T22:16:30.492Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-dialogue-model-is-trained-by-processing-entire-multi-turn-conversations-as-single-concatenated-seq/fasPbJ0uWBjPOMKnx4yF</loc>
            <lastmod>2025-10-02T03:09:48.891Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-challenge-of-universal-ethics-in-ai-alignment/fbQgAOa4rPilikUhGdLL</loc>
            <lastmod>2025-10-06T19:32:23.486Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-feedback-collection-method/fcDDDjf31YCvdJ3Ef9Uf</loc>
            <lastmod>2025-10-10T04:42:55.613Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-modeling-the-generation-of-a-sequence-of-states-and-actions-as-a-markov-decision-process-the-pr/ffCLqqnczkUF3Sc3tgD5</loc>
            <lastmod>2025-10-06T01:41:08.941Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-value-model-is-trained-using-a-loss-function-that-minimizes-the-squared-difference-between-its-cur/fg0yZAL9C38PMtRgL92U</loc>
            <lastmod>2025-10-03T21:07:59.017Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-model-roles-in-knowledge-transfer/fjETZlMYmIDYDETme0E3</loc>
            <lastmod>2025-10-10T07:52:48.835Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-pointwise-rating-loss-behavior/fkxnGlIK88lA9YrVPuOn</loc>
            <lastmod>2025-10-07T09:13:56.101Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/batch-size-for-sequential-data-in-ac-value-loss/fo6TsTDgCmNK6HPY1GCX</loc>
            <lastmod>2025-10-10T01:22:02.638Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/less-than-inequality/fomEORr582vpKR9nudRi</loc>
            <lastmod>2026-06-25T15:27:25.326Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fixed-model-assumption-in-dpo-optimization/fopyasUbqfwzTqBPEfdv</loc>
            <lastmod>2026-05-03T00:35:44.011Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-language-model-alignment-strategy/friazxgxwtuFnvvyHIpb</loc>
            <lastmod>2026-02-08T13:25:29.486Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/performance-metric-for-instruction-tuned-llms/fsZlw0cWQ9ZklasE8e5g</loc>
            <lastmod>2026-05-01T10:46:27.078Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-engineer-wants-to-add-an-extra-reward-signal-denoted-as-a-function-f-to-an-/ftUuTA7n22bpRSuPycXu</loc>
            <lastmod>2025-09-28T11:48:55.777Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-a-prompt-for-public-outreach/fteXwxHTfM4mNvPXoKxQ</loc>
            <lastmod>2025-10-03T04:44:36.078Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/equivalence-of-maximizing-auto-regressive-log-likelihood-and-minimizing-cross-entropy-loss/fuYZzOa6JMPjHhZrXzJb</loc>
            <lastmod>2025-10-10T09:31:09.554Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-symptom-duration-one-week/fxZVvTGLfUTkP9mdFeXy</loc>
            <lastmod>2025-10-05T13:30:05.138Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-static-datasets-in-model-fine-tuning/fzIxZ8DLAGqZ7rsMyKVC</loc>
            <lastmod>2025-10-10T07:33:45.199Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/simplified-notation-for-preference-probability-models/fzQC5GL6Hpp5YOYhjjki</loc>
            <lastmod>2025-10-06T20:38:32.207Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-feature-prioritization-based-on-data-complexity/fzRgm06hAFv4pMfTPOL3</loc>
            <lastmod>2025-10-05T23:50:26.075Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/solution-approaches-in-prompt-engineering/fzcHssTxEKdc4AncYBe3</loc>
            <lastmod>2026-04-30T22:54:35.577Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-adapts-a-pre-trained-language-model-using-a-dataset-of-customer-support-questions/fznfwHnSqSFPd1nlRmty</loc>
            <lastmod>2025-09-28T19:22:38.099Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-a-sarcasm-detecting-ai/gAAzyXgqOoWU2BZgxOgI</loc>
            <lastmod>2025-10-05T22:57:33.641Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-weighted-probability-distribution/gBMI1GvVRAdy35wtWplS</loc>
            <lastmod>2026-06-20T19:07:28.896Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/contrasting-environments-in-learning-systems/gC9YvQB0W3tGY1JRmhAB</loc>
            <lastmod>2025-10-02T10:37:53.426Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/methods-for-mitigating-sparse-rewards/gDDjOWwRUlTg1Vrrfsev</loc>
            <lastmod>2026-05-02T23:57:17.215Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-model-performance-components/gDXhrzbNDNE8lvkaMNqs</loc>
            <lastmod>2026-02-08T14:18:45.392Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sequential-context-compression-with-an-rnn-like-mechanism/gDeUuuJXPaTXMaej2bs3</loc>
            <lastmod>2026-05-01T10:29:30.135Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-score-transformation-on-preference-probabilities/gDj382bPNl1JS3j24OHM</loc>
            <lastmod>2025-10-03T21:13:57.044Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/identifying-the-agent-and-action-in-a-training-scenario/gHDtbYEyaeG9t6sEh5WZ</loc>
            <lastmod>2025-10-01T22:47:20.802Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-self-driving-cars-navigation-system-needs-to-make-a-decision-it-calculates-two-potential-routes-th/gHS4EGIvbKtP0pNqfW9T</loc>
            <lastmod>2026-06-29T21:01:57.589Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/auto-regressive-decomposition-of-conditional-log-likelihood/gHbw3azrB5m4nCEgdRL4</loc>
            <lastmod>2026-06-26T11:34:12.809Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-a-baseline-for-policy-optimization/gJOyFaQXza4PnK2zcu0q</loc>
            <lastmod>2025-10-07T15:28:43.816Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-function-in-terms-of-q-values-and-v-values/gLDcgSckl66qtxuegjQK</loc>
            <lastmod>2026-05-01T16:47:08.553Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ppo-clipped-objective-for-language-models/gNmzAcewamb0XD9k7SqV</loc>
            <lastmod>2026-07-03T01:17:11.015Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/modifying-a-chatbots-behavior/gQXRtzWq0k22bF1KGwqZ</loc>
            <lastmod>2025-10-03T16:26:14.765Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-training-instability-from-reward-design/gRTXs2fzCKydfSPYb1ix</loc>
            <lastmod>2026-05-01T16:24:16.966Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-training-via-ranking-loss-minimization/gRezthPljTjHtA3u61nd</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/representing-a-performance-threshold/gSLFTutyCpSrU9MhmFhZ</loc>
            <lastmod>2025-10-08T13:00:01.491Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-data-scientist-is-analyzing-customer-satisfaction-ratings-for-three-different-product-versions-lab/gTlOCAwWfMTSpQB45vmX</loc>
            <lastmod>2026-07-04T00:11:54.724Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-training-a-language-model-using-two-separate-reward-models-one-that-rewards-he/gVGBEwjnpH9biiP5OP0z</loc>
            <lastmod>2025-10-01T20:20:20.764Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-using-a-reinforcement-learning-algorithm-where-the-value-networks-loss-is-/gWqrkRujZPz46je0GQ7C</loc>
            <lastmod>2025-09-26T06:43:24.397Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-preparing-a-large-synthetically-generated-dataset-for-fine-tuning-a-language-model-they-su/gWuXqgKGguYZZMoYntRs</loc>
            <lastmod>2026-02-08T14:29:21.091Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-training-a-language-model-to-generate-helpful-and-harmless-dialogue-responses-the/gXJhcPqpV2uL4C5chm4c</loc>
            <lastmod>2025-10-02T03:15:46.096Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-gives-a-large-language-model-the-following-prompt-generate-a-short-realistic-sounding-news-re/gYEWye7sjj5Y1ZcTvF6G</loc>
            <lastmod>2025-10-06T11:19:12.625Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-reward-model-to-score-the-quality-of-ai-generated-poetry-their-team-/gbI0FvT32IKMFbLdzANS</loc>
            <lastmod>2025-09-28T11:59:59.609Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-single-round-vs-multi-round-prediction-problems/gbWJ7IbGqJxyZINcwDcS</loc>
            <lastmod>2026-05-01T00:25:51.199Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-provides-a-large-language-model-with-a-prompt-containing-several-existing-tas/geMExH8rhlPLhQ2RRw76</loc>
            <lastmod>2025-09-26T03:13:30.616Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-faulty-sequence-generation-process/geSuW4Z9IbWcMI1xDJQt</loc>
            <lastmod>2025-10-02T06:49:28.416Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-training-a-model-to-score-the-quality-of-ai-generated-text-they-are-considering-t/gf7Jhi3h4m6Aw1JxBkjH</loc>
            <lastmod>2025-09-28T16:03:40.867Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/distinguishing-model-outputs-in-preference-alignment/gfy2k9hWXyT7xZeOFGp0</loc>
            <lastmod>2025-10-03T05:05:10.732Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-an-agent-for-a-text-based-game/gioqnrmPAf5GrF4w6puX</loc>
            <lastmod>2025-10-02T08:01:19.529Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-fine-tuning-resource-requirements/gjbrd9AQm5CKqg4lxNbL</loc>
            <lastmod>2026-02-08T14:26:33.997Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-dpos-fixed-model-assumption-with-ppo/gl9CaxJutCCDlpEhXe6G</loc>
            <lastmod>2026-05-03T00:36:02.972Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-reward-model-to-score-segments-of-text-generated-by-a-language-model-the-stan/gleCUK5UAIlliEF9D5lk</loc>
            <lastmod>2025-10-02T02:15:26.965Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-agent-is-trained-to-navigate-a-virtual-room-and-clean-up-messes-the-agent-is-rewarded-based-on/goYfOW6vr6o297ssNvcw</loc>
            <lastmod>2025-10-07T09:03:15.141Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-adapting-a-large-pre-trained-language-model-to-a-new-task-by-optimizing-a-set-of/gtTAHVchLZkDoCt60qKx</loc>
            <lastmod>2025-10-03T06:20:28.943Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/efficiency-of-prompt-based-model-guidance/gwel56fykyr1Q0MooEeI</loc>
            <lastmod>2025-10-10T09:20:23.700Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-given-the-input-prompt-write-a-short-poem-about-a-rainy-day-it-generates-the-res/gwghwvrFtqG6sdeKs3ZT</loc>
            <lastmod>2025-09-26T13:12:31.233Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-alignment-with-human-expectations/gwt2qS9shTUpWpYNVbUg</loc>
            <lastmod>2025-10-08T13:02:21.893Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critiquing-a-model-training-hypothesis/gyZTkHog9lqfbY6HBGmP</loc>
            <lastmod>2025-10-03T02:55:47.581Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-using-a-baseline-in-policy-gradients/gzsR0aSIsBZd1MhqnBIS</loc>
            <lastmod>2025-10-08T16:53:48.415Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-flawed-model-alignment-pipeline/h04ON8CK8TE12M4fsEFv</loc>
            <lastmod>2025-10-02T04:15:26.621Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-outcome-based-rewards-for-entire-sequences/h07uL1uEo3MigQFjbuLo</loc>
            <lastmod>2026-05-03T01:24:22.399Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitation-of-pre-trained-llms-next-token-prediction-vs-instruction-following/h4jssBduRw1kKb5jEt2b</loc>
            <lastmod>2026-04-30T23:33:48.347Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-trajectory-utility-with-importance-sampling/h6UpLJ8qWAaQdjbyszh1</loc>
            <lastmod>2025-10-03T21:17:09.210Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-data-scientist-trains-two-models-model-x-and-model-y-on-the-same-dataset-for-the-same-task-the/h9RHHIR99yNMCeGkzThV</loc>
            <lastmod>2025-10-04T02:12:00.478Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-alignment-avoiding-harmful-requests/h9vKvDhYqmZj8mvWDHEH</loc>
            <lastmod>2026-05-01T15:50:41.846Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-provided-with-the-initial-input-sequence-x-the-sun-is-shining-and-the-the-model-/hBcBnhlRFa5hddWM6SwA</loc>
            <lastmod>2025-09-29T01:54:10.308Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-fine-tuning-project-feasibility/hCLZxUX6qFgLc7oMAWuR</loc>
            <lastmod>2026-02-08T14:26:28.909Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dpo-as-an-offline-reinforcement-learning-method/hDyJ2YzDDdIeMuH6WJHf</loc>
            <lastmod>2026-05-03T01:03:13.146Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-has-access-to-a-large-general-purpose-language-model-that-was-developed-by-training-i/hENobBstjC5t1kQpDKcq</loc>
            <lastmod>2025-10-01T20:21:45.241Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-reviewing-an-internal-llm-pilot-and-need-t/hF1kS2wrVZ9VOZks9xDk</loc>
            <lastmod>2026-02-06T18:26:37.010Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-to-generate-text-at-a-certain-step-it-considers-generating-the-nex/hH91mBYnzvxrjfdxiCen</loc>
            <lastmod>2025-09-26T08:24:04.131Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-pre-training-only-strategy/hHFSDWX0spG9y0sibGQL</loc>
            <lastmod>2025-10-01T20:50:36.197Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-operating-under-a-policy-parameterized-by-theta-this-policy-can-result-in-one-of-two-pos/hHQWQhXdIQlrsX8Jgy3P</loc>
            <lastmod>2025-10-02T02:24:49.727Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applicability-of-policy-gradient-methods/hHYQ972xNx1I6GIjVn7W</loc>
            <lastmod>2025-10-03T20:09:43.125Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-startup-is-developing-an-ai-powered-chatbot-for-a-rapidly-evolving-mobile-game-the-game-receives-u/hHjOxcnAtkbk7Zmpb94Y</loc>
            <lastmod>2025-09-26T13:26:16.079Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/baselines-impact-on-reward-variance-vs-gradient-estimate-variance/hHk23WTtQoN7co8dytdE</loc>
            <lastmod>2026-05-01T16:35:30.273Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-training-instability-in-language-model-fine-tuning/hJ9P9bEVHjVcmwvOvzyk</loc>
            <lastmod>2025-10-01T19:21:25.465Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/explaining-accelerated-learning-in-reinforcement-learning/hKK4KnJc7Ld8dGB2IHhf</loc>
            <lastmod>2026-05-17T20:53:15.841Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-models-as-human-expert-proxies-in-llm-alignment/hKTZRu7mOWDY0okhSBVN</loc>
            <lastmod>2026-04-30T23:26:05.613Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/action-value-function-formula/hMXJZpVNElz5yPVnk4Zm</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-data-samples-for-instruction-following/hNqhP73YVFmZNfCE4uq8</loc>
            <lastmod>2025-10-08T12:25:09.285Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/denoising-autoencoder-training-objective/hPMo6p6NFqmygZcVVuwM</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/modeling-house-price-predictions/hQI9CyE0r0OFjnyjrjby</loc>
            <lastmod>2026-04-29T04:19:16.594Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/refining-prompt-templates-in-self-instruct/hRNpKlnT84ZAb0m7t05J</loc>
            <lastmod>2025-10-06T21:02:57.137Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-multiset-of-state-action-pairs/hRqnYZHJcMrOzH92HyfU</loc>
            <lastmod>2025-10-10T01:31:44.536Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applicability-of-process-based-approaches/hUgwsekEnBu9M7RJTbxs</loc>
            <lastmod>2026-05-03T15:20:47.785Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-using-a-reward-model-that-provides-a-single-quality-score-for-a-co/hXdM700J3Yi6oE3B7txY</loc>
            <lastmod>2025-10-03T00:34:25.019Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-building-a-dataset-to-improve-a-language-models-ability-to-follow-instructions/hYF1tCRtLaaNYJqnM767</loc>
            <lastmod>2025-10-02T04:34:39.736Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-logs-three-events-in-a-specific-order-first-login-then-query-and-finally-logout-which-of-th/hYYZHIDLmZVviJkPNzVQ</loc>
            <lastmod>2026-06-30T09:58:54.482Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-aims-to-improve-its-chatbots-ability-to-answer-questions-about-its-products-the-proposed-p/hYgjR9XCRvYKq1OZ0Kax</loc>
            <lastmod>2025-09-29T00:49:01.985Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ranked-preference-notation/hZcrj90ziXbcrJJUzPhE</loc>
            <lastmod>2026-06-29T05:13:10.319Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-policy-update-step/hbDMSPQ9IjeY5EmzRwsa</loc>
            <lastmod>2025-10-07T09:16:01.894Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/objective-function-for-fine-tuning-a-strong-llm-with-weak-supervision/heWPv9t9jWgeqb6lLe2k</loc>
            <lastmod>2026-05-01T14:47:20.471Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-a-fine-tuning-dataset-for-a-customer-support-chatbot/hf0gMSZPsCgx3qoIm6Yk</loc>
            <lastmod>2026-02-08T13:55:06.426Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-training-strategy-for-a-dynamic-task/hjHi7NHuAEIPEdvXhmhJ</loc>
            <lastmod>2025-10-06T00:25:31.161Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-trust-region-size-trade-off/hmfgcDMaEjk8XiW4auoq</loc>
            <lastmod>2025-10-06T23:49:44.061Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-tutor-data-generation-strategy/hoynopbS6CYHEzixJGzq</loc>
            <lastmod>2025-10-04T06:15:57.900Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-training-strategy/hpL709BIjLoOoMModfKZ</loc>
            <lastmod>2025-10-03T01:52:38.177Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-paraphrased-task-description/hpRdDeYYcxmxsumlfU42</loc>
            <lastmod>2025-10-05T18:14:17.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-notational-conventions/hqRFWOi0pg5h6h4Nkm4C</loc>
            <lastmod>2026-04-29T04:19:16.996Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/chain-of-thought-cot-reasoning/hqmxm2Y0urCVDFUDxmcr</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-dialogue-model-training-efficiency/hrJJV2zXNM4rFYsufzET</loc>
            <lastmod>2025-09-26T03:37:10.105Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-dpo-and-rlhf-loss-functions/hrOcR1jNt06ZDomkASvu</loc>
            <lastmod>2026-05-03T00:58:01.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/differential-impact-of-baselines-on-variance/htfSW5AIbBD71qfr2KhW</loc>
            <lastmod>2025-10-05T23:31:32.181Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-system-where-a-very-long-detailed-set-of-instructions-is-compressed-/huCY7G5VAu3M8fAef0Pt</loc>
            <lastmod>2025-10-01T21:41:57.979Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prompt-for-extracting-financial-figures-from-an-earnings-report/hvUSj6jvtgiH7wDUjy8A</loc>
            <lastmod>2026-06-27T17:54:58.410Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/predictive-inference-formula-in-large-language-models/i1LV3n9mXWeyAx7UFDgY</loc>
            <lastmod>2026-06-21T21:52:35.540Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/simplified-policy-optimization-objective-as-kl-divergence-minimization/i3OcwFVc9IBbcp2Rmuom</loc>
            <lastmod>2026-05-03T00:50:20.391Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-inter-task-generalization/i4BMV6ZTiVVOuRNJyyZZ</loc>
            <lastmod>2026-05-01T10:47:02.097Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/weak-performance-pweak-as-a-baseline-metric/i58v5ailTlCH3yDzxl27</loc>
            <lastmod>2026-05-01T14:55:53.747Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-policy-gradient-training/i5qvi4YuyuL608rq8s80</loc>
            <lastmod>2025-10-08T22:34:37.850Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-reward-model-to-assess-the-quality-of-multi-paragraph-essays-to-do-this-they-/i6OlLwdD4sqHIuz60Xaj</loc>
            <lastmod>2025-09-26T06:28:59.478Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ppo-objective-at-the-reference-point/i7ZvN58oqgwTPvdZ23ZM</loc>
            <lastmod>2025-10-02T08:15:16.332Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/function-of-a-sequence-of-averaged-vectors-notation-sbarmathbfy-dots-barmathbfyk/i85aP2lMnRvVMxt0SIzd</loc>
            <lastmod>2026-07-03T00:57:01.337Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-model-is-being-trained-using-a-combined-objective-this-objective-includes-a-distillation-los/i8NxRgPygyzKiYTN6BL5</loc>
            <lastmod>2025-10-06T11:21:36.873Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-starts-with-a-large-pre-trained-language-model-their-goal-is-to-make-this-model-a/i8TMaiwM6dkqzG9ByaBK</loc>
            <lastmod>2025-09-28T22:01:04.296Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-model-is-being-trained-for-a-listwise-ranking-task-for-one-training-example-it-must-rank-three-ite/i9a66T8RXg2eb4ZhkiHF</loc>
            <lastmod>2025-09-29T00:50:28.542Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-with-reward-to-go-and-baseline/iBQgFqEUo8Upf8R2Btx2</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-building-a-system-to-classify-customer-support-emails-as-urgent-or-not-urgent-/iBrOF7qocHFGmZ83t3qE</loc>
            <lastmod>2025-09-26T14:13:31.689Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/lack-of-interpretability-in-soft-prompts/iBssqjtbk4JnWKv56w3o</loc>
            <lastmod>2026-04-30T22:43:50.420Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-team-is-training-a-system-to-learn-from-human-preferences-they-have-a-dataset-where-for-a-give/iDKCzeMWjH53MoKf0w2y</loc>
            <lastmod>2025-09-26T08:49:21.390Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-training-a-smaller-student-model-using-a-combined-objective-that-learns-from-both-a-larger-teac/iDNhGWN2JSbPukwQS1kd</loc>
            <lastmod>2025-10-02T10:20:55.510Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-gap-between-demonstration-and-intent-in-llm-training/iFGmx397GHZTPHvu9z8Q</loc>
            <lastmod>2025-10-07T10:27:41.511Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-in-an-environment-where-its-sole-objective-is-to-maximize-the-sum-of-rewar/iGTJv5nElL2jG1bW5BaX</loc>
            <lastmod>2025-09-26T02:19:45.261Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-decoder-only-language-models-with-cross-entropy-loss/iJpPFiBmxYtwihTRdVb3</loc>
            <lastmod>2026-04-29T16:07:25.192Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-policy-gradient-methods-a-baseline-b-is-subtracted-from-the-total-reward-for-a-trajectory-r-to-re/iJzaXVNM0l9AZR25p5Zi</loc>
            <lastmod>2025-10-07T08:12:50.236Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/two-teams-are-developing-a-machine-learning-model-to-classify-customer-support-tickets-team-a-adapts/iLjR19nvbPATyuw2LjsU</loc>
            <lastmod>2025-09-28T17:45:09.027Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-refining-a-language-model-using-a-method-where-for-each-training-step-a-prompt-is-selected/iNdwvWnP0eMSCSmLszHc</loc>
            <lastmod>2025-09-26T10:29:22.072Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-behavior-analysis-in-a-simulated-environment/iOLgDHUVCe6DU1mW7HNi</loc>
            <lastmod>2025-10-07T04:34:22.628Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ensemble-of-three-models-is-used-to-predict-a-numerical-value-the-individual-predictions-are-mode/iOmg6mXSIHP2oPzqKqCZ</loc>
            <lastmod>2025-10-10T08:42:44.788Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/structure-of-an-instruction-fine-tuning-sample/iPArKt8xs4HbcxxmuqjR</loc>
            <lastmod>2026-04-19T21:18:49.182Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-prediction-confidence-on-reward-model-loss/iPXhgzpoRTvekIjSNkcR</loc>
            <lastmod>2025-10-08T23:38:16.772Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-machine-learning-system-a-penalty-is-assigned-to-every-generated-output-segment-using-the-funct/iQYMBC7wK1W32cWoaQhy</loc>
            <lastmod>2026-06-26T06:35:29.204Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-training-method-for-a-story-writing-ai/iRBpmBWbu9oKCgWNRORZ</loc>
            <lastmod>2025-10-06T20:59:54.082Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/value-function-loss-minimization-in-rlhf/iS05BcwwVe39BHgbUGaz</loc>
            <lastmod>2026-06-26T01:17:55.192Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-objective-with-advantage-function/iSS7EM2iPiI0AnOIq7jj</loc>
            <lastmod>2026-05-01T16:44:17.569Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-unintended-model-behavior-after-adaptation/iTZ0RjhEMAg40Bt5181Z</loc>
            <lastmod>2025-10-06T19:37:10.242Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-tasked-with-creating-a-compact-learned-soft-prompt-that-can-effectively-replace-a-ver/iUO4m6lk9MMI6w86YEaS</loc>
            <lastmod>2025-09-26T02:03:15.288Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/parameter-efficient-fine-tuning-peft/iV2is9mC7qGMokavKys5</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-models-performance-failure/iVbfd8rPQYLNyErlhz5D</loc>
            <lastmod>2025-10-06T17:49:37.228Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/mechanism-of-policy-model-refinement/iYUQwpMBfD2oujJhBP0S</loc>
            <lastmod>2025-10-03T18:34:36.605Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/pairwise-comparison-for-human-feedback-in-rlhf/icyAIXrpAkT1GY1KAEWr</loc>
            <lastmod>2026-06-30T17:00:35.911Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-relationship-between-prompts-and-contexts/if1yyWLklLWxkhfVfPPD</loc>
            <lastmod>2025-10-06T12:06:27.210Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/equivalence-of-training-objectives/ifvusBZeVVy23Hs8njq0</loc>
            <lastmod>2025-10-02T05:41:36.044Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-sft-dataset-characteristics/ig6zaqUG3m2GW8xJHFrJ</loc>
            <lastmod>2025-10-06T16:42:37.218Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-implementation-using-a-pre-trained-llm/igzFprbXFGsVJEyzlyLp</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-prompt-could-you-maybe-give-me-the-chinese-version-of-this-english-text-is-an-example-of-a-stand/ihFutgPCY0YatKlPVzY9</loc>
            <lastmod>2025-10-10T01:33:43.598Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-starts-with-a-base-language-model-that-has-been-pre-trained-on-a-massive-general-/ihHMyUHAD6eD1I95qF0P</loc>
            <lastmod>2025-10-05T00:59:58.673Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-standard-instruction-for-english-to-chinese-translation/ihWAwRtzE4hP1kTmX39y</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reference-policy-pithetatextref/iiIb0Ojx7MOHfCjyUXWB</loc>
            <lastmod>2026-06-30T20:20:28.332Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-component-of-the-action-value-function-formula-qs-a-mathbbesumtinfty-gammat-rt-s-s-a-a-pi/ikXSD5UqRrHDbTRMjKrF</loc>
            <lastmod>2025-10-08T22:28:37.365Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/automating-preference-data-for-chatbot-politeness/imYPOOPlzDXEmQlzbk0T</loc>
            <lastmod>2025-10-10T06:37:08.063Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-technology-startup-has-successfully-pre-trained-a-large-language-model-with-several-hundred-billio/inKtACXGlg5CQRxZQAbc</loc>
            <lastmod>2025-10-02T20:52:28.483Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-model-generalization/issxBs64BEe83mAyzqAM</loc>
            <lastmod>2025-10-02T20:47:43.082Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-is-interacting-with-a-language-model-to-plan-a-vacation-analyze-the-following-conversationtur/itktmihTC80LzHhkWRlZ</loc>
            <lastmod>2025-09-26T05:13:24.380Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-unstable-reinforcement-learning-training/iutQjOgvE4ZjqOxWRzPm</loc>
            <lastmod>2025-10-02T11:23:52.802Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-flaw-in-an-instruction-generation-pipeline/iwrwFPvW2ZrT6C1D3wac</loc>
            <lastmod>2025-10-10T06:41:10.248Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/target-model-policy-model-in-rlhf/ixbyYmKaxC9Y2pDP8yz2</loc>
            <lastmod>2026-06-28T19:57:47.937Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-policy-updates-with-a-divergence-penalty/izZtXS1CnH6BtlJuqL7t</loc>
            <lastmod>2025-10-07T10:09:53.319Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dense-vs-sparse-rewards/j05qx0ThQWw38dswBhFW</loc>
            <lastmod>2026-05-01T16:15:04.442Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-language-model-using-human-feedback-for-a-given-prompt-the-model-generates-two-/j1unAhXfk4C2fd6f5ri6</loc>
            <lastmod>2025-09-28T17:01:27.923Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-spends-several-weeks-manually-writing-and-testing-hundreds-of-prompts-to-optimize/j6HDxjwwcugQfpl92mjz</loc>
            <lastmod>2025-10-02T23:12:20.287Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/seeking-professional-medical-advice-for-symptoms/j7TFGec8Wpj58KvRRvda</loc>
            <lastmod>2025-10-06T21:20:56.339Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-and-mitigating-reward-hacking/j8rVeGbGQxw9NT1cym7x</loc>
            <lastmod>2025-10-03T05:35:39.820Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-proposed-modification-to-a-sequential-processing-model/j9eopQ9NScyriL7eo0Tl</loc>
            <lastmod>2025-10-05T17:23:21.961Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crowdsourcing-data-for-fine-tuning/j9pIrf1Qx6AOI44KinLE</loc>
            <lastmod>2026-05-01T01:06:53.699Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prioritizing-influential-data-for-fine-tuning/jCr4sSo0MqOorWPGSaSg</loc>
            <lastmod>2026-05-01T10:30:12.681Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/plackett-luce-loss-function/jDae1ntwIZ0NlY91gG5H</loc>
            <lastmod>2026-05-02T23:31:06.362Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-for-evaluating-generated-text-uses-a-scalar-scoring-function-rinput-output-to-assign-a-nume/jFZLBzLAaKANrpsOiEFP</loc>
            <lastmod>2025-09-26T07:02:03.485Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/self-instruct-process/jGq3WO9b3Q4mGPy8TJHN</loc>
            <lastmod>2026-05-01T01:24:25.714Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-actor-critic-ac-method/jHPyoNp1sxUgWwZIwf8J</loc>
            <lastmod>2026-05-01T16:43:51.198Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-state-value-in-a-deterministic-environment/jI4hJMdDQmNxTdsTmxFH</loc>
            <lastmod>2025-10-03T19:57:39.579Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-prompts-structure-for-in-context-task-learning/jICppP3D9puKyIsOdXZ0</loc>
            <lastmod>2026-04-29T04:14:29.817Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-llms-initial-troubleshooting-step/jIEXRpdhsV4qnamOVZQE</loc>
            <lastmod>2025-10-05T18:01:36.454Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/targeted-sft-data-curation-for-stylistic-control/jIHZc2AjSgOqEzGq7KnX</loc>
            <lastmod>2025-10-07T10:12:29.748Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-fine-tuned-using-a-dataset-of-prompts-x-preferred-responses-ya-and-dispref/jJluJRuTlb79VX4UV20u</loc>
            <lastmod>2026-05-03T00:58:01.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-pre-trained-language-model-using-a-curated-dataset-of-customer-s/jJynkmp1nwU8USkSqJZy</loc>
            <lastmod>2025-09-26T13:27:48.602Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-an-alignment-pipeline-and-debugging-a-dpo-objective-under-compute-and-data-constraints/jKFHvBU1UY2nFpvSEqO5</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/effectiveness-of-large-and-diverse-pre-training-for-out-of-distribution-generalization/jMyZ79AveuOb4AmWkL6G</loc>
            <lastmod>2026-05-01T14:38:04.397Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-a-smart-thermostat-system/jOMOvf6FcbXii4M4tcZ0</loc>
            <lastmod>2025-10-02T11:19:23.915Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-reward-model-training-approach-with-the-description-that-best-fits-its-methodology-and-a-/jQ0vGz8ooys2KMacIJFJ</loc>
            <lastmod>2025-10-10T08:29:42.381Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-building-a-dataset-to-fine-tune-a-language-model-for-a-new-specialized-domain-/jQAONh7RnWeQgaoTaSBx</loc>
            <lastmod>2025-10-10T06:00:08.686Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/identifying-optimal-policy-parameters-from-training-data/jQbxuCeotfEQhDJuAptl</loc>
            <lastmod>2025-10-06T22:36:36.813Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/workflow-for-crowdsourcing-fine-tuning-data/jQtonwgwPXD6aW2qHlZc</loc>
            <lastmod>2025-10-10T06:03:08.995Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-generates-a-response-that-is-evaluated-by-breaking-it-into-four-distinct-segments-a/jS3xXy9BWCUqx3lquOiW</loc>
            <lastmod>2025-10-07T08:17:26.352Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-aims-to-build-a-more-reliable-reward-signal-for-their-ai-system-by-combining-the-outputs-of-s/jSP4skbvYQ2d0SjYOuek</loc>
            <lastmod>2025-10-03T04:01:58.095Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-system-is-being-trained-to-generate-helpful-multi-turn-dialogues-a-state-value-function-which-/jSYp6q6kspcP2SeUnalt</loc>
            <lastmod>2025-09-29T12:08:08.233Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-faulty-language-model-training-process/jSoNl3nTvKsFZIPzqog5</loc>
            <lastmod>2025-10-03T21:29:14.785Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-designed-to-understand-a-multi-chapter-novel-due-to-processing-limitations-it-re/jXiMs12XEiKAPbPyU4WN</loc>
            <lastmod>2025-09-28T22:01:48.264Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-prompt-template-for-instruction-generation-in-self-instruct/jalgZmSZfoCr3mAKyteO</loc>
            <lastmod>2026-05-01T01:23:44.185Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-is-pre-training-an-internal-llm-for-a-co/jbeEIQM3zq2I5qWXWiKt</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-following-equation-that-defines-a-target-policy-pitheta-based-on-a-reference-policy-pit/jc29G2EE4c8Z9LH64ZaN</loc>
            <lastmod>2025-10-04T02:05:50.873Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/normalization-factor-for-a-reward-weighted-policy/jdPlH7E3TrAOwXi0O5ow</loc>
            <lastmod>2026-05-03T00:45:00.402Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/classifying-an-alignment-approach/jfTMnGE5ikoykV4orp1d</loc>
            <lastmod>2025-10-05T01:01:44.587Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/model-performance-evaluation/jiAKBaCYov4mCUip9wwf</loc>
            <lastmod>2025-10-03T18:25:25.860Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dataset-sourcing-strategy-analysis/jiGlv7UiIundZkVfGMOw</loc>
            <lastmod>2025-10-06T03:18:21.579Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-feedback-mechanisms-for-ai-training/jlECNomClYeskuDCM2hk</loc>
            <lastmod>2025-10-02T05:59:39.091Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/probability-based-supervision-signals-for-reward-models/jlPd06oJ010QLHphkpDm</loc>
            <lastmod>2026-05-03T01:09:40.250Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/deconstructing-a-model-training-interaction/jlnFMWDpnmqFDljAEVdE</loc>
            <lastmod>2025-10-06T04:13:40.364Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/hand-crafted-features-and-templates-as-early-prompts/jpAw71ONgDXSZy72y0fh</loc>
            <lastmod>2026-04-30T22:55:27.598Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-trained-using-a-method-where-human-annotators-assign-an-absolute-quality-score-to-/jqy66222V2mEb5tDAa5w</loc>
            <lastmod>2025-10-06T16:55:35.890Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/baseline-method-for-policy-gradient-variance-reduction/jrCgFNmbXsCJXV452ysv</loc>
            <lastmod>2026-06-17T21:49:43.796Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-methodology-designed-to-bootstrap-a-large-set-of-instructional-data-the-initial-seed-tasks-used/juAtFUYgCpXeF1J8FmeQ</loc>
            <lastmod>2025-10-10T03:53:18.782Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/chatbot-interaction-analysis/jvInZ7DsMctpMGrGKh2X</loc>
            <lastmod>2025-09-26T05:31:20.331Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-undergoes-two-distinct-training-stages-in-the-first-stage-it-is-trained-on-a-massiv/jxvEfzgZzfHGfKkgPNWe</loc>
            <lastmod>2025-10-02T05:13:09.400Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/automated-segment-scoring-via-llm-generated-ratings/jzn42oFmvhF6Wmf5CHyg</loc>
            <lastmod>2025-10-10T01:40:32.323Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/conflicting-evaluation-criteria-in-ai-feedback/k5sz3UhvM9DlApQPyBsY</loc>
            <lastmod>2025-10-06T01:13:21.914Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/segment-based-rating-loss-function/k5u5wdgKkcu1hlEo0dOB</loc>
            <lastmod>2026-05-03T00:07:22.449Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-implementing-a-process-to-generate-training-data-the-process-begins-with-manually-cre/k64CgAaFm9GG0tzpLsjm</loc>
            <lastmod>2025-10-01T20:12:17.907Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-ais-financial-advice-response/k6CRrhJeStA1sBZgEu2i</loc>
            <lastmod>2026-02-08T13:19:12.507Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-content-moderation-feedback/k6jbJXwa79hfvV6UiQ5j</loc>
            <lastmod>2025-10-06T13:36:12.581Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/increased-urgency-of-ai-alignment-with-advances-in-ai-capabilities/k6vs1Sf0ycj4dEsuUywr</loc>
            <lastmod>2026-05-03T16:03:27.617Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fundamental-questions-in-prompt-engineering/k78tDjeARZoYDOYCOv3m</loc>
            <lastmod>2026-04-30T22:54:13.488Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-co-occurring-symptoms-fatigue-and-headaches/k7XiXemZzSkWIFImP9Q9</loc>
            <lastmod>2025-10-05T13:59:58.359Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-curating-a-high-quality-dataset-for-training-a-large-language-model-you-decide-t/k7wUMRGtd4GP3vgAqDiX</loc>
            <lastmod>2025-10-10T03:10:59.798Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-user-query-for-a-healthcare-qa-model/kCh85RjGpMGYr7shdFnM</loc>
            <lastmod>2026-04-30T22:45:52.973Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-designed-to-process-extremely-long-sequences-of-text-during-inference-to-manage-/kDJ4jk184R7XovJgH5fR</loc>
            <lastmod>2025-09-28T16:41:27.074Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-trained-on-a-dataset-of-input-output-pairs-x-y-two-different-training-obje/kDKrM0NWGyMNovculoKC</loc>
            <lastmod>2025-09-26T08:48:36.188Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-policy-gradient-learning-in-a-high-variance-environment/kFKyVv9YQpcSfNL5BP78</loc>
            <lastmod>2025-10-01T20:43:25.083Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-language-model-to-write-compelling-short-stories-they-decide-to-provide-a-singl/kIj2Xkizl0OeeuCXm3wB</loc>
            <lastmod>2025-09-28T19:31:52.975Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/combining-small-and-large-models/kJG6gsRc5aJB4YFnGxRx</loc>
            <lastmod>2026-05-01T15:08:35.268Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-provides-the-exact-same-simple-instructionsummarize-the-provided-article-about-renewabl/kL0qeLsLBR0U5LW3qNdV</loc>
            <lastmod>2025-09-26T13:24:50.884Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-primary-reason-direct-policy-optimization-dpo-is-considered-more-sample-efficient-than-proximal-/kN0PMMkpzi2xLoEHUc0R</loc>
            <lastmod>2025-10-10T08:14:16.965Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/divergence-in-llm-performance/kQE5TkxAdoVp0bOZtTP9</loc>
            <lastmod>2025-10-02T11:35:11.990Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-model-is-designed-to-rank-a-set-of-three-documents-doc-a-doc-b-doc-c-for-a-given/kR27Yp7SGdWH81RmDu0g</loc>
            <lastmod>2025-10-02T02:31:33.213Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-undesirable-model-behavior/kRCWJPKKIAvDBHC2hRN5</loc>
            <lastmod>2025-09-26T11:37:17.396Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-dataset-for-model-behavior-adaptation/kS5oe7xKR9hlsg7sdSi4</loc>
            <lastmod>2025-10-02T22:15:04.219Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/end-of-sequence-reward-assignment-in-rlhf/kUb68p0c76Y6QtEkp7w8</loc>
            <lastmod>2026-05-02T23:50:29.529Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-individual-describes-experiencing-a-new-persistent-and-sharp-pain-in-their-side-to-an-online-symp/kaT47aEuwyppn1jkYB8J</loc>
            <lastmod>2025-10-06T21:20:48.203Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/post-deployment-drift-after-rlhf-diagnosing-reward-model-and-ppokl-interactions/kbdmivkp2Fc4WESUeKqv</loc>
            <lastmod>2026-02-06T17:53:29.047Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-startup-with-a-limited-budget-wants-to-develop-a-specialized-ai-assistant-for-customer-support-the/kc9dxPj0Es4EWepHbRpM</loc>
            <lastmod>2026-02-08T14:08:48.225Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/outcome-based-approaches-for-llm-fine-tuning/kcTaecOvS0YB5FsufcFb</loc>
            <lastmod>2026-05-03T15:04:04.645Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-given-trajectory-if-the-calculated-advantage-ast-at-ktt-rk-vst-is-negative-it-implies-that-the-/kceQ4hIf5mIbQVe3mK4q</loc>
            <lastmod>2025-10-08T22:50:25.450Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-actions-with-a-state-value-baseline/kd85TmMz2FpswM6g6YLk</loc>
            <lastmod>2025-10-03T03:40:43.472Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-component-of-the-policy-notation-yt-x-yt-to-its-correct-description-in-the-context-of-an-/kdaZLs98cLm6UjEZXQFr</loc>
            <lastmod>2026-06-26T20:30:27.190Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/inputs-for-segment-based-reward-calculation/kdbBxR3EQyx8zuwfqSk0</loc>
            <lastmod>2025-10-04T04:35:32.977Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/refining-a-data-extraction-prompt/ke0BV0D53ZbbDH2xjL41</loc>
            <lastmod>2026-06-27T17:54:58.410Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-models-behavior-is-guided-by-a-target-probability-distribution-which-is-defined-by-re-wei/kg1WyG0FVoiC7afnoofw</loc>
            <lastmod>2025-10-07T08:07:42.710Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-trains-a-language-model-to-write-helpful-summaries-of-news-articles-the-models-performance-is/kgYf553d1Yq030KV8JTI</loc>
            <lastmod>2025-09-26T10:18:00.781Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-discovery-that-pre-trained-models-could-be-effectively-directed-to-perform-new-tasks-without-bei/kiW89h2XwSOKajGl8Apr</loc>
            <lastmod>2025-10-03T01:17:31.504Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-function-estimation-using-reward-to-go/klwLDxJWwDRm2gpqWofQ</loc>
            <lastmod>2026-06-20T19:42:55.095Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-building-a-system-to-classify-customer-feedback-they-have-three-different-models-each/km9iYphTVhwqcf8FnRGx</loc>
            <lastmod>2025-10-06T17:06:24.173Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-using-formality-features-in-machine-translation/kmOBMdm0CXpMdZiimmTq</loc>
            <lastmod>2025-10-10T01:46:01.994Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-policy-gradient-methods-subtracting-a-baseline-from-the-total-reward-is-a-technique-used-to-reduc/kn46Ihiuwyj0KNtbc0bC</loc>
            <lastmod>2025-10-06T14:47:07.495Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-state-definition-for-next-token-prediction/kocOkdyLPlYqWsipmL5B</loc>
            <lastmod>2025-10-10T01:46:41.761Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-prompt-paraphrasing/kowCCisBonCqRIhWJfGv</loc>
            <lastmod>2025-10-10T03:02:01.587Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-the-supervised-fine-tuning-objective-is-written-as-tildetheta-arg-maxtheta-summathbfxmathbfyinm/kq52eobf8p7sVj0xlE1t</loc>
            <lastmod>2025-10-02T08:13:17.260Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-prompting-strong-vs-weak-llms/krNn0PgIGVpOxz65gVSK</loc>
            <lastmod>2026-04-30T23:03:04.607Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-is-evaluating-an-instruction-tuned-language-model-using-a-performance-metric-denoted-as/ksc4rTNfaJiUHq3uz7cz</loc>
            <lastmod>2026-02-08T14:18:45.281Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-using-a-large-language-model-to-solve-multi-step-mathematical-word-problems-they-obse/ku5ijpHzk03h9I72Zo91</loc>
            <lastmod>2025-10-02T23:31:21.679Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-strategy-for-a-legal-ai/l0X0605qWp4CZN1MN6fX</loc>
            <lastmod>2025-10-05T18:37:31.591Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/shift-from-fine-tuning-to-prompting-with-pre-trained-models/l15QtUDvfr9BX2Lz8WAw</loc>
            <lastmod>2026-04-30T22:55:50.824Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/visual-representation-of-iterative-soft-prompt-refinement/l2NkK2td31vmFnBuUTXj</loc>
            <lastmod>2026-06-20T04:27:29.949Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-llm-performance-issues/l36u7HoFV9WKkA21PiBG</loc>
            <lastmod>2025-10-05T15:16:49.260Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-conflicting-rlhf-signals-reward-model-ranking-vs-ppo-updates-under-kl-regularization/l39tREmdDdD2a9te9MpD</loc>
            <lastmod>2026-02-06T16:58:56.487Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-preference-model-calculates-the-probability-of-response-a-being-preferred-over-response-b-using-th/l48b8ja821JJCNt8isze</loc>
            <lastmod>2025-10-08T16:31:32.904Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-provided-with-a-context-c-translate-the-following-sentence-for-a-medical-profess/l4Pw8JktUoY4JZ1ZCQJC</loc>
            <lastmod>2025-09-27T23:39:37.499Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/root-causing-a-prefix-tuning-rollout-regression-in-a-multi-task-llm-platform/l64QjEalfqRG5fyPRdIG</loc>
            <lastmod>2026-02-06T18:01:57.893Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-sequence-notation/l8HYZrJ1NgTcA8IUQzDO</loc>
            <lastmod>2026-06-30T09:58:54.482Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/maximum-likelihood-training-objective-for-a-dataset-of-sequences/l8ObcLw9PxgjHgFo1HCm</loc>
            <lastmod>2026-06-27T21:47:34.617Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-using-a-self-instruction-method-to-generate-a-large-dataset-of-tasks-in-their-pro/lA787wuJ0vAkCIVPkYZC</loc>
            <lastmod>2025-10-05T19:08:29.451Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/cascading-models-at-inference-time/lGF31wOP2DpidgUWl6H2</loc>
            <lastmod>2026-05-01T15:26:53.082Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-pointwise-reward-model-loss/lGiPJClKKa9j2alJwGnR</loc>
            <lastmod>2025-10-02T02:14:42.193Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/conditional-probability-formula-for-sequence-generation/lHaTjqzU7vOGP5Oh9pxU</loc>
            <lastmod>2026-07-02T06:27:45.900Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-wants-to-adapt-a-pre-trained-language-model-for-a-specific-business-need-their-pl/lJYB2JWBXeylWxDVL2I5</loc>
            <lastmod>2025-10-01T21:19:04.823Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-improving-a-text-generation-model-the-process-involves-providing-the-model-with-an-input-p/lN9wvyn4iAdpCTwZ8Zoj</loc>
            <lastmod>2025-10-02T09:30:21.428Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-regularization-parameter-in-policy-optimization/lNqIJDuGoKhXDIOdap7H</loc>
            <lastmod>2026-05-03T00:35:23.712Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reinforcement-learning-agent-decision-analysis/lP6sNm6S7FBngBe4GACR</loc>
            <lastmod>2025-10-07T09:34:00.890Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-flawed-solution-to-reward-hacking/lPbHk9T0YqrTd6ctVPWN</loc>
            <lastmod>2025-10-06T12:09:34.612Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-following-mathematical-derivation-which-attempts-to-rewrite-the-policy-gradient-with-a-/lU9VasqjGexgx313VZb3</loc>
            <lastmod>2025-09-28T13:21:30.254Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-in-reinforcement-learning/lVZsG3zwFknHfychzaoJ</loc>
            <lastmod>2025-10-06T21:59:06.212Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-prompting-and-the-continued-need-for-fine-tuning/lXbPBFfY5akW2MSSiTQJ</loc>
            <lastmod>2026-04-29T16:07:34.475Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/developing-a-multi-function-customer-service-ai/lXlmjcCRiU7NnXyL5SfD</loc>
            <lastmod>2026-02-08T14:41:27.999Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-wants-to-improve-a-pre-trained-models-alignment-by-making-its-responses-more-/la4sccwH9tEd0ebbUgGz</loc>
            <lastmod>2025-10-10T05:09:51.782Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-the-state-function-in-sequence-generation/lb5ixjcb7N4iJptyXpDr</loc>
            <lastmod>2025-10-08T15:23:02.435Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-a-policy-with-off-distribution-data/ldH0L0Zu74KyblPkiqI0</loc>
            <lastmod>2025-09-26T15:05:43.890Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agents-experience-is-recorded-as-a-sequence-of-four-state-action-pairs-first-s-a-then-s-a-then/lfZBPyQYnR02YXLoYsz3</loc>
            <lastmod>2025-09-28T23:38:13.459Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-memory-augmented-model-processes-a-long-document-by-breaking-it-into-sequential-segments-for-any-g/lgEmQ0jPzpkCRcSD5XPi</loc>
            <lastmod>2025-10-05T19:01:29.128Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-assistant-fine-tuning-strategy/lgSGUUAddTi1Uh6C0MqR</loc>
            <lastmod>2026-02-08T14:36:06.163Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-agent-action-sequences/lgmKrY9WSBcPTQHFzSNx</loc>
            <lastmod>2025-10-08T16:47:05.796Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-has-a-small-high-quality-dataset-for-training-a-sentiment-analysis-model-to-impro/lhFDfAO4oRFmtBZxy11Q</loc>
            <lastmod>2025-10-05T23:16:20.445Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-aligning-a-large-language-model-to-better-follow-human-preferences-using-a-rewar/lhI64Mb6WOeFwYKRXLJU</loc>
            <lastmod>2025-10-07T09:50:04.901Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-is-fine-tuning-a-billion-parameter-language-model-they-decide-to-double-the-/lhSd0kkfLN7UsvCzgUKd</loc>
            <lastmod>2026-02-08T14:26:33.820Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-startup-is-developing-a-language-model-to-provide-personalized-financial-advice-to-a-global-audien/lhVeo6VrybAnpzE9mAp3</loc>
            <lastmod>2025-09-26T07:02:48.465Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/explaining-emergent-zero-shot-abilities/liGqqJHorE4oLLIvHihS</loc>
            <lastmod>2025-10-06T12:13:15.550Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-is-implementing-a-training-process-that-uses-human-feedback-to-align-a-langu/lrjXTqmGBK9aZ7d7FZ4x</loc>
            <lastmod>2025-09-26T03:50:33.106Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-the-scaling-parameter-on-policy-behavior/lwyMOoEhAT9SqdIvS3Ys</loc>
            <lastmod>2025-10-08T20:57:08.326Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-two-distinct-natural-language-processing-scenarios-scenario-involves-a-system-that-maps-wor/lxq0UoylXGnW2PWBPscX</loc>
            <lastmod>2025-09-28T19:11:35.688Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-shaping-as-a-solution-for-sparse-rewards/lxxsouHd2PwBpqaOkM4x</loc>
            <lastmod>2026-06-26T13:50:43.956Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/your-team-is-pre-training-an-internal-llm-to-suppo/lyg6DiHGRjiaGuzBVPT1</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-small-startup-with-limited-resources-is-fine-tuning-a-large-language-model-to-create-a-general-pur/lzpTeVbCPbFXoA31w3yS</loc>
            <lastmod>2025-10-05T18:20:53.276Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prompting-an-llm-for-semantic-segmentation/m33i5wLFVrZExmz2VWoa</loc>
            <lastmod>2025-10-10T03:09:33.125Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-reward-calculation-method/m3sUWW9jZ3MkL8woVj4y</loc>
            <lastmod>2025-10-08T21:09:19.981Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/behavior-of-the-rating-loss-function/m6MQgn8b1Dd6CF3QDmEF</loc>
            <lastmod>2025-10-08T22:49:03.713Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-fine-tuning-a-language-model-using-a-reinforcement-learning-process-guided/m7mtLMYxapUAacbsupaV</loc>
            <lastmod>2025-09-26T02:02:34.679Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-function-definition/mAc00z0BG3ppLH0lOsCF</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-adapted-for-a-specific-task-using-a-technique-where-a-small-set-of-trainab/mBBfYOVkVvt13krDteZ7</loc>
            <lastmod>2025-10-04T06:15:13.528Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critique-of-a-data-collection-strategy/mCTYc8q7BcIZqxsFQ0LL</loc>
            <lastmod>2025-10-06T13:15:34.697Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-being-trained-using-a-loss-function-that-includes-a-regularization-term-to-prevent/mFFFN9HNIVpgKVMmPgV6</loc>
            <lastmod>2025-09-29T12:19:35.501Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/classifying-language-model-interaction-scenarios/mIaJQ0TEJYaZudrAbtcB</loc>
            <lastmod>2025-10-10T08:05:17.852Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-reward-function-under-policy-convergence/mJ88q2hfj4Q3BpRqziO2</loc>
            <lastmod>2025-10-08T20:11:07.225Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/transformed-reward-function-formula/mLWooRI944fVj6IBN0RV</loc>
            <lastmod>2026-06-26T13:50:47.215Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/inflexibility-of-soft-prompts/mO7J70GGRheD4HwatomL</loc>
            <lastmod>2026-04-30T22:44:22.977Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-generates-text-by-calculating-the-probability-of-the-next-word-given-all-the-preced/mOLDS3Rei6tuXRGiyI5U</loc>
            <lastmod>2025-10-08T22:53:24.137Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-loss-function-for-an-actors-policy-is-given-by-l-e-log-as-asa-where-asa-is-the-advantage/mQVdJH8ELYrGsJIWVmTX</loc>
            <lastmod>2025-10-02T02:36:52.185Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-a-performance-benchmark/mQePDTYY8OLRRUaQnnOZ</loc>
            <lastmod>2025-10-07T15:12:43.302Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-the-impact-of-model-scale-on-instruction-following/mUPfhAffUydxoBNtPftr</loc>
            <lastmod>2025-10-02T11:25:44.195Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-diagram-shows-a-two-stage-process-for-handling-an-input-x-in-step-a-small-model-processes-x-to/maJFnWvcPZ4Pf1T1yne6</loc>
            <lastmod>2025-10-06T11:34:18.409Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-fine-tuning-strategies-for-generalization/mahyr6wdHtWwJmvHMyEI</loc>
            <lastmod>2026-02-08T14:04:46.798Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-chatbot-responses-on-a-budget/man0t14ZQRofMUwPh6xm</loc>
            <lastmod>2025-10-02T19:08:39.432Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-a-prompt-for-a-specific-technical-problem/mcDCcAFemMF843oytmIg</loc>
            <lastmod>2025-10-05T18:06:44.320Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-wants-a-large-language-model-to-solve-a-multi-step-logic-problem-they-are-considering-two-dif/mcbpJ6yCN7jALBGNdzNB</loc>
            <lastmod>2025-09-28T23:47:44.993Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-reward-scale-variation-on-policy-gradient-variance/md9uLMGKnJEI8vDckdvN</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-task-an-agent-completes-two-distinct-trajectories-trajectory-a-results-i/mdGHleyDtFRIrgMtWkJs</loc>
            <lastmod>2025-09-26T02:57:04.285Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/bayesian-model-averaging-for-combining-reward-models/mdNVQ1vZ12cDi9YVX8Zq</loc>
            <lastmod>2026-05-03T00:23:28.555Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/for-aligning-a-language-model-with-human-preferences-there-are-two-main-approaches-a-complex-multi-s/me6C7I4oqrZlKNjZHkeR</loc>
            <lastmod>2025-10-05T23:54:33.582Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/surrogate-objectives-in-ai-alignment/mePnp0RzyL0StBrn31iC</loc>
            <lastmod>2026-05-03T15:46:47.494Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-formula-for-llms-in-reinforcement-learning/meyumv6TukOe53EZbqa7</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/equivalence-of-surrogate-and-on-policy-gradients-at-the-reference-point/mfiFgDKYPN4vG4z7ZIWQ</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-training-an-agent-with-a-policy-gradient-method-notices-that-the-learning-process-is-uns/mh3ABqpceQX2PFhH7NBb</loc>
            <lastmod>2025-09-28T23:32:23.486Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-pre-training-objective-mismatch-from-product-failures/mhrKL4Hll8jBikgCZOxR</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-impact-of-a-state-value-baseline/miUKlgLT9q2XkM84vrHb</loc>
            <lastmod>2025-10-07T00:21:03.686Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-is-training-a-language-model-to-generate-summaries-of-scientific-research-papers-the-initi/mlmhLPYjCZ7SaQ3KDZmM</loc>
            <lastmod>2025-10-02T21:16:30.914Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prioritizing-chatbot-alignment-strategies/moCDlizv2ESK52oKv6S7</loc>
            <lastmod>2026-02-08T13:18:53.780Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/distinguishing-sequence-level-vs-element-level-functions/moDlZrGR0NuoKoHXA53H</loc>
            <lastmod>2026-06-28T12:18:15.729Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-data-generation-strategies-for-model-robustness/mpjBZHvW1JEdc0jqvDdA</loc>
            <lastmod>2025-10-10T03:04:12.406Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-in-a-state-s-and-must-choose-between-two-actions-a-and-b-according-to-the-agents/mqCXB9Swtyz71pPfwOIJ</loc>
            <lastmod>2025-09-28T12:37:21.841Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-refining-a-text-generation-model-the-final-probability-of-a-generated-text-sequence-is-pro/mtwQZDOzQvbuauD3YyeT</loc>
            <lastmod>2025-09-26T10:36:25.775Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-customer-service-bot-failure-analysis/mu1aS3Q6UVb6677jOEyn</loc>
            <lastmod>2025-10-02T10:07:04.623Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/clipped-surrogate-objective-function/muqsH9CMgIPCJWy2wvOL</loc>
            <lastmod>2026-05-01T18:37:16.986Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/prompting-as-a-motivator-for-universal-foundation-models/mvKPuWANGruGLokIWIQj</loc>
            <lastmod>2026-04-30T22:56:13.323Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-improving-a-large-powerful-model-using-a-smaller-less-capable-model-and-a-large-/mxjgRYCjPRgr75z0XUZc</loc>
            <lastmod>2025-10-09T01:13:13.280Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-training-issues-with-policy-divergence/mzvS4bdYDUsHZsbpfOZt</loc>
            <lastmod>2025-10-04T01:42:29.325Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-small-non-profit-research-lab-with-a-limited-budget-aims-to-fine-tune-a-language-model-to-assist-i/n0iAyvbu7mVTKxOkLIwn</loc>
            <lastmod>2025-10-02T20:23:28.326Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-cumulative-objective-in-dialogue-models/n2xV7wT0YH8ytbOtE9y9</loc>
            <lastmod>2025-10-09T00:16:16.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consequences-of-bounded-memory-in-text-summarization/n38T2BNiL7L5s2tmO5JV</loc>
            <lastmod>2025-10-06T17:35:58.280Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-large-pre-trained-language-model-to-act-as-a-specialized-legal-a/n4jYCnWCX6DYGYGS6LQi</loc>
            <lastmod>2025-10-02T08:14:36.578Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dynamic-state-in-llm-policy/n4kxlzI4745Y3pGPliko</loc>
            <lastmod>2025-10-04T04:09:33.287Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/combining-reward-models-as-an-ensemble-learning-problem/n55vl0C3VmMg6OpIMpya</loc>
            <lastmod>2026-05-03T00:19:10.797Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/true-or-false-in-a-basic-policy-gradient-method-if-an-agent-completes-a-trajectory-with-a-high-posit/n5aeJ4zMcycVaHCxrOfE</loc>
            <lastmod>2025-10-06T13:37:45.783Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autoregressive-language-model-has-processed-the-input-the-cat-sat-on-the-and-is-now-deciding-the-/n6qdkGlPyOU1NQBq8M3R</loc>
            <lastmod>2025-09-26T02:21:12.093Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-refining-a-large-language-model-to-be-more-helpful-and-safe-using-feedback-fro/n9znOEbwPOOmuV4im5ML</loc>
            <lastmod>2025-10-06T19:57:52.876Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/suitability-of-fine-tuning-for-aligning-with-human-values/nBQN9tDXcSHTzFVZNydX</loc>
            <lastmod>2026-05-03T15:43:42.019Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-reinforcement-learning-a-penalty-is-often-used-to-prevent-a-policy-from-changing-too-drastically-/nDHAGCCm8LOVptAGclZe</loc>
            <lastmod>2025-10-06T02:58:04.670Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/necessity-of-multiple-llm-alignment-methods/nFTIMwPZbC5OmAy1WDdO</loc>
            <lastmod>2026-04-30T23:13:23.800Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-human-feedback-for-llm-alignment/nH6HfWmJFp3WKbyfuqHJ</loc>
            <lastmod>2025-10-06T22:28:57.536Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-sft-data-sample-quality/nHbv9ViSfAtTdCe7RLUB</loc>
            <lastmod>2025-10-04T08:21:24.679Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/role-and-definition-of-the-reference-model-in-rlhf/nHhSqoJUfjvykrI9EmlC</loc>
            <lastmod>2026-05-02T23:17:47.127Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-estimate-under-uniform-trajectory-probability/nHhweEOu6WOzyH1O8VfP</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-wants-to-use-a-large-language-model-to-automatically-create-a-preference-dataset-for/nIzisYSgiKBzXJKZtLFU</loc>
            <lastmod>2025-10-05T22:01:44.287Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-language-model-alignment-issues/nJJS62SSHGqt6UOKHEI5</loc>
            <lastmod>2025-10-03T21:40:06.685Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-trade-offs-in-policy-optimization-for-language-models/nJhtmQKUADcdXsotrolH</loc>
            <lastmod>2025-09-28T23:17:52.722Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-is-tasked-with-fine-tuning-a-general-purpose-language-model-to-specialize-in/nMed6H1OVYtT7XOOzAy5</loc>
            <lastmod>2025-09-29T00:49:43.088Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/predictive-model-variable-selection/nNkqO1MtitvcVzOMz4Qy</loc>
            <lastmod>2025-10-03T01:31:01.994Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-software-developer-is-building-a-new-email-client-they-want-to-add-a-feature-that-automatically-so/nS1gcTklYWx2yC1KdoS2</loc>
            <lastmod>2025-09-26T02:26:20.118Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/explaining-score-discrepancies-in-trained-models/nVK4uADCu4Mo9ITGbUcl</loc>
            <lastmod>2025-10-07T12:04:07.481Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/difficulty-of-human-annotation-for-complex-tasks/nWKGEtHrv3nOYxfHuZcF</loc>
            <lastmod>2026-02-08T14:52:41.975Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-mixed-instruction-sampling/nXUNaBJS0Ty3Ayf9l2T8</loc>
            <lastmod>2025-10-10T03:59:57.277Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-study-tracks-the-final-exam-scores-for-students-in-four-different-sections-of-a-computer-science-c/nbYys6xn3cBf3lvfB50U</loc>
            <lastmod>2025-09-26T05:14:09.364Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-is-designed-to-write-compelling-story-summaries-and-it-is-rewarded-based-on-the-summarys-lengt/nbvzgdVPbZ3TGuSEm53x</loc>
            <lastmod>2025-10-02T07:47:21.129Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/for-a-policy-gradient-method-to-be-applicable-the-cumulative-reward-function-must-be-differentiable-/nc7oyrvfYUnRELqGOTyx</loc>
            <lastmod>2025-10-06T19:12:32.727Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-the-value-function-with-a-reward-model/ndriEcn2J3DccHg4LjTr</loc>
            <lastmod>2026-06-27T22:11:30.841Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/arrange-the-following-events-in-the-correct-chronological-order-to-describe-a-single-update-step-for/ne4F3yh2JVzLAhy8cjoP</loc>
            <lastmod>2025-10-10T06:13:08.803Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-data-collection-strategies-for-a-niche-ai-tool/ngaMqSc9B2OCp1TgCD8I</loc>
            <lastmod>2025-10-03T02:01:09.558Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-correlation-coefficient-values/njVbiaZSx8HLiLgLzxvC</loc>
            <lastmod>2026-06-17T18:40:47.262Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantages-of-online-reinforcement-learning-for-llm-alignment/nkIcMV2iRBVZgdHrPxpk</loc>
            <lastmod>2026-05-03T01:03:50.559Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/regularized-pairwise-loss-function-for-reward-model-training/nljnu359KRUFOZnofx5N</loc>
            <lastmod>2026-05-02T23:39:08.659Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-system-to-determine-the-best-tasting-coffee-blend-they-collect-data-/npDSwcBuTbJcWA7x916J</loc>
            <lastmod>2025-10-03T19:28:21.625Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/introducing-a-baseline-into-a-policy-gradient-algorithm-is-an-effective-technique-for-reducing-the-v/nq5P1QoDFKDLrqqDLNQk</loc>
            <lastmod>2025-10-10T08:06:37.605Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-objective-as-maximization-of-the-performance-function/nqLJNPCsMnFSA8rFrUJ4</loc>
            <lastmod>2026-05-01T16:13:28.863Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-prompt-template-for-a-new-translation-task/nqe2XBdyy6m15WqWoFid</loc>
            <lastmod>2026-04-19T20:35:04.310Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-completes-an-episode-with-the-following-sequence-of-rewards-r-r-r-r-when-updating-the-polic/nrEw9cAExlOhDRmqbk5p</loc>
            <lastmod>2025-10-04T03:33:11.637Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-an-sft-data-point/nsiRI2nIXDn94hAYMKDA</loc>
            <lastmod>2025-10-06T15:35:09.780Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-following-steps-demonstrate-that-the-surrogate-objective-which-uses-importance-sampling-is-equiv/nuqFZA21ANOJUGvpBnE8</loc>
            <lastmod>2025-10-04T03:10:12.253Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-an-agent-that-completes-a-five-step-sequence-of-actions-receiving-the-following-rewards-at-/nv7qeLHL59k8xuJNEynd</loc>
            <lastmod>2025-10-08T21:38:14.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-model-adaptation-strategies/nvFNW5FnA93sVuAiTe2m</loc>
            <lastmod>2025-10-02T05:31:42.210Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-data-sourcing-strategy-for-a-specialized-chatbot/nwaKB2bDwnBo7XfTRrYs</loc>
            <lastmod>2025-09-26T01:53:48.284Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-approximated-policy-divergence/nwgOamGwvsqfkYwWMZnq</loc>
            <lastmod>2025-10-03T21:13:11.883Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/application-of-sample-efficiency-in-advanced-learning-techniques/nx8bD3D9KraojBptbFkg</loc>
            <lastmod>2026-05-01T10:36:46.970Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dynamic-adjustment-of-the-knowledge-distillation-coefficient/nyZ8jTcFcHvKHXVzlXnz</loc>
            <lastmod>2026-05-01T15:44:10.066Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-training-a-model-to-score-chatbot-responses-based-on-human-feedback-their-data/nzXkvKKnjyo8PNpEMlMC</loc>
            <lastmod>2025-10-06T23:22:45.035Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/addressing-data-mismatch-in-policy-gradient-training/o3Xe4b3ulu1LQttkASnp</loc>
            <lastmod>2026-06-17T21:33:04.789Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/instruction-alignment/o3jMpYcfpuJm6XdflWNe</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-in-reinforcement-learning-pi/o4BXd7NxwnLS9O5wi0k3</loc>
            <lastmod>2026-06-28T20:44:36.648Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/small-model-based-data-selection/o6msnJwi4IxitebK2SGX</loc>
            <lastmod>2026-02-08T14:29:11.027Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-pre-training-objective-under-data-constraints-and-deployment-needs/o7Fg6EE6ZO6tR02PiFFS</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sft-as-language-model-training-on-concatenated-sequences/o895brPJFxp0zwHXb9RJ</loc>
            <lastmod>2026-05-01T00:03:00.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-a-spam-classification-prompt/o8nSPB8QcKUmBC0y7sLF</loc>
            <lastmod>2025-10-04T08:22:08.984Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/standard-model-ensembling-for-llms/o9ZKRY3AkSWiZOw2GOkX</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/goal-of-reinforcement-learning/o9lUxbY3vZrYIVBLNG0O</loc>
            <lastmod>2026-05-01T16:07:48.328Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-creating-a-new-dataset-to-improve-a-large-language-models-capabilities-they-are-c/oBP3efJTaRUbU6bv9eN8</loc>
            <lastmod>2026-02-08T14:40:17.258Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-using-an-inference-time-rescoring-process-to-select-the-best-summary-for-a/oCkMlT9p5dJPoTaxTgLT</loc>
            <lastmod>2025-10-03T05:13:19.902Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-fine-tuning-a-language-model-with-reinforcement-learning-the-optimization-objectiv/oDIqKoVrCfSxKoT5R6OT</loc>
            <lastmod>2025-10-07T10:36:16.816Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-fine-tuning-datasets-for-a-general-purpose-ai/oFH8e8MPzdRzxpMRpNWf</loc>
            <lastmod>2026-02-08T14:36:11.802Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/asymmetric-effect-of-upper-bound-clipping/oFt0sdQAJs3mwaZyzpST</loc>
            <lastmod>2025-10-04T02:22:18.695Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/leveraging-existing-data-for-prompt-creation/oHrk6m19f8wivQJTYB8G</loc>
            <lastmod>2025-09-26T07:14:52.941Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-a-fine-tuning-strategy/oIGOZhDurDtPeaLK5Wcp</loc>
            <lastmod>2025-09-28T20:46:03.539Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consequences-of-modifying-the-ppo-objective-function/oKW5ooJjcMJUo93CQqYj</loc>
            <lastmod>2025-10-08T14:34:25.144Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/listwise-ranking-for-human-feedback-in-rlhf/oKX4WKKzGOQ6W6JHuhnJ</loc>
            <lastmod>2026-05-02T23:24:35.039Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-fine-tuning-a-language-model-and-observes-that-the-training-process-is-highly-unstabl/oMFcmKs95nJWRJDNkKPE</loc>
            <lastmod>2025-10-07T04:30:43.810Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-model-performance-issues/oOq1DuUnXlcm04iIc1Ls</loc>
            <lastmod>2026-02-08T14:52:51.489Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-reward-model-failure/oPWe7RVm76mWI7hwIXLy</loc>
            <lastmod>2025-10-08T14:13:12.210Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-the-plackett-luce-model-to-rlhf-reward-modeling/oQBQki6Fbg6KvUsjJwi7</loc>
            <lastmod>2025-10-06T22:50:51.231Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-computational-system-processes-the-word-phrase-deep-learning-models-are-powerful-it-generates-a-se/oQrIx6isugt2Vh3Ic5Yn</loc>
            <lastmod>2026-06-30T07:51:32.715Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantage-function-as-td-error-in-rlhf/oRuVuAwKNolEWu03Gq3p</loc>
            <lastmod>2026-07-03T01:17:10.856Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/application-of-synthetic-data-in-the-pre-training-stage/oTmiilOx4uLncn2GKWKC</loc>
            <lastmod>2026-05-01T10:20:46.309Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-assistant-is-trained-to-generate-helpful-summaries-of-scientific-papers-the-system-uses-a-rewa/oUUI7KnlUXiaThzvfvlk</loc>
            <lastmod>2025-10-07T08:53:04.979Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-optimization-objectives-in-model-training/oUpVmJPoFKtxXqsY4b0N</loc>
            <lastmod>2026-04-29T03:51:58.907Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-implementation-debugging/oX46yOoQVawTiJxwhJKj</loc>
            <lastmod>2025-10-10T02:28:12.720Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-flawed-log-likelihood-calculation/oXwM6IhxD7agUDMvxwzG</loc>
            <lastmod>2025-10-08T22:14:24.210Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-training-instability-in-reinforcement-learning/oYEaOluvlCGf3pvlokPO</loc>
            <lastmod>2025-09-26T14:17:25.088Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/linguistic-and-semantic-segmentation-for-reward-modeling/oaTI0hjOfs7a8QIUQqAo</loc>
            <lastmod>2026-05-03T00:16:54.980Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-data-quality-on-fine-tuning-sample-size/od1lvmFqHnzmnETQ04Iz</loc>
            <lastmod>2026-05-01T10:29:31.630Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autonomous-agent-is-being-trained-to-navigate-a-maze-and-reach-a-specific-exit-the-agent-receives/oeZH1xtgFVG5H898XLrg</loc>
            <lastmod>2025-09-29T02:17:37.650Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-model-performance-via-cross-entropy-loss/ogAOJOWoa4Qk4EzeizQj</loc>
            <lastmod>2026-04-29T03:51:58.783Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/root-cause-analysis-of-pre-training-objective-leakage-and-coherence-failures/oi82FuzDfiUevmmHRD7k</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-chatbots-reward-function/oidEGDi7lPGtizOdh1Rr</loc>
            <lastmod>2025-10-04T17:20:38.290Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/worth-function-in-plackett-luce-for-rlhf-reward-modeling/okKzn3vl1PsX6e34b4df</loc>
            <lastmod>2026-06-24T21:24:12.053Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/classification-of-llm-adaptation-methods/oliJj9WY2h6LXrb3vgsL</loc>
            <lastmod>2025-10-10T09:12:56.073Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/transferring-a-specialized-skill/olijsXePpsBxS14KD4aq</loc>
            <lastmod>2025-10-05T20:08:45.664Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/relationship-between-joint-conditional-and-marginal-log-probabilities-of-sequences/om7tKDY9WaeV6glCCpnt</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-data-augmentation-strategy/ooKL4MInctthjRsXz9in</loc>
            <lastmod>2025-10-10T03:35:22.787Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/characteristics-of-soft-prompts/ooVDI6slnHNNRBoadAIQ</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-a-reward-weighted-probability-distribution-defined-as-pimathbfymathbfx-fracpitheta/osvccJfIkUbczCrCnTOk</loc>
            <lastmod>2025-10-08T22:13:44.171Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/advantages-of-crowdsourcing-fine-tuning-data/ouCDlaEwkW3y3jjQXBa7</loc>
            <lastmod>2025-10-06T22:59:12.109Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fine-tuning-efficiency-and-performance/ov696Nl9QSwvmSvnIG5Z</loc>
            <lastmod>2025-10-05T21:10:38.711Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-update-analysis/ow0qQIuac2z99H7KybZG</loc>
            <lastmod>2025-10-08T23:52:55.547Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-alternative-fine-tuning-objective/owSx6F2J82TIj7x4ysyC</loc>
            <lastmod>2025-10-08T20:13:36.729Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-scenario-where-for-a-given-input-mathbfx-there-are-only-two-possible-outputs-mathbfy-and-/owosOM6nEWSxGwcy6dr4</loc>
            <lastmod>2025-09-29T01:14:18.676Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/controlling-translation-formality/oyS8LToISQttaysid4il</loc>
            <lastmod>2025-10-04T16:14:53.302Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-dpo-and-ppo-sample-efficiency/ozQOb1znvPPn5yxIHWs5</loc>
            <lastmod>2026-05-03T00:58:27.387Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-has-developed-a-new-policy-denoted-as-new-for-navigating-a-maze-the-g/p08QE0cNehS50rX61Dra</loc>
            <lastmod>2026-06-29T07:14:54.434Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rlhf-training-process-with-ppo/p0l4ZXBSIQzJMlqqR2jD</loc>
            <lastmod>2026-05-02T23:17:08.695Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-a-language-models-design-for-code-debugging/p1EZDR43AEBd06LpXbJs</loc>
            <lastmod>2025-10-01T23:04:59.661Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/youre-implementing-a-peft-approach-for-a-customer/p3SR16vrw61HtFOEHn8c</loc>
            <lastmod>2026-02-06T18:02:33.561Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-self-instruct-filtering-strategy/p3Wt9jhHSQudNgfuhJFq</loc>
            <lastmod>2025-10-10T05:15:04.695Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/challenge-of-defining-human-values-for-ai-objectives/p4gSqdAvzQZSN8QvvIn7</loc>
            <lastmod>2026-05-03T15:47:13.889Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-policy-optimization-phase-where-the-objective-is-to-minimize-the-loss-function-lx-y-y-r-t/p8IJXg2rsFDomD9tDH5b</loc>
            <lastmod>2025-10-03T21:18:45.088Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/irrelevance-of-past-rewards-for-policy-gradient-calculation/p9jZTS6oLedSQTqoXOWe</loc>
            <lastmod>2026-05-10T01:37:25.473Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-trade-off-in-policy-optimization/pAEIf8UaY6qIUisV4s0D</loc>
            <lastmod>2025-10-04T02:02:18.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-set-of-learnable-continuous-parameters-to-serve-as-a-compact-substitute-for-a-l/pBc5DT1IV6cvDjAAfzDA</loc>
            <lastmod>2025-10-03T03:40:03.910Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-system-that-uses-an-ensemble-of-three-different-reward-models-to-evaluate-the/pCfQPBJYqeSgPwg32z2O</loc>
            <lastmod>2025-09-29T03:09:10.449Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-an-actor-critic-reinforcement-learning-algorithm-the-policy-pithetaas-is-updated-to-maximize-the-/pHoaXsRFq36WyIu8zJH1</loc>
            <lastmod>2025-09-26T14:57:40.039Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-observes-that-their-language-model-which-has-been-trained-on-a-large-dataset-/pI6LriTu9myug4RrpZe5</loc>
            <lastmod>2025-09-26T11:34:34.333Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-llm-response-alignment/pIkVDfM86IeheNwuqB10</loc>
            <lastmod>2025-10-08T13:02:12.289Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-training-a-language-model-for-a-question-answering-task-the-training-/pIsqh8dncJ9nfANp5b1T</loc>
            <lastmod>2025-10-08T15:54:21.295Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-chatbot-operational-costs/pJnURJWwfVt5pjoWl16L</loc>
            <lastmod>2025-10-06T11:40:35.124Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-wants-to-create-a-new-specialized-language-model-they-plan-to-use-a-larger-more-p/pKAw1UGjVKHBZUQ0IZIM</loc>
            <lastmod>2025-10-10T02:39:35.029Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-listwise-ranking-task-if-the-training-objective-is-to-minimize-the-negative-log-likelihood-of-t/pKJzofHmtEOOW6cvkOaW</loc>
            <lastmod>2025-10-06T21:21:29.509Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-chatbots-response-score/pLhMqnOiJ21AXEhWgTvv</loc>
            <lastmod>2025-10-06T23:29:00.837Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-a-prompt-for-a-specific-use-case/pMT3FEe9D8WBm2duHbdi</loc>
            <lastmod>2025-10-05T12:25:47.273Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dynamic-segmentation-for-reward-modeling/pMc9QZpMSDLixK8fZH2S</loc>
            <lastmod>2026-05-03T00:16:18.869Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-wants-to-generate-a-one-paragraph-summary-of-a-long-article-they-provide-the-entire-article-t/pOr1vyiIfZZ7cm3O3npp</loc>
            <lastmod>2025-10-05T17:02:14.676Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-utility-for-sequence-generation/pPSTzA8dlAa3YqAGjkUn</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-models-performance-is-evaluated-using-a-loss-function-l-where-represents-the-mode/pQirK5hZ3So30piecAfT</loc>
            <lastmod>2025-09-28T16:15:12.210Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/dataset-level-objective-for-multi-round-conversational-models/pQp44WbepEKu0Vc7MSAu</loc>
            <lastmod>2026-05-01T00:39:57.823Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/constructing-a-fine-tuning-sample/pTBXThFe3cd0NhlgU9ZL</loc>
            <lastmod>2026-02-08T14:02:11.392Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-data-collection-pipeline-for-a-creative-writing-assistant/pUxWYuGfBwZ1NJU2VY2m</loc>
            <lastmod>2025-10-10T03:14:25.381Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-fine-tuning-of-a-large-language-model-using-an-advantage-actor-critic-ac-method-the-model/pVoJqRa8cMSVb3AAQTal</loc>
            <lastmod>2025-09-26T03:28:17.551Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-reinforcement-learning-agent-using-a-policy-based-method-they-observe-the-/pWCU2CI7ZVo6TNLSqaJQ</loc>
            <lastmod>2025-10-01T20:03:44.182Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/total-reward-as-sum-of-segment-based-scores/pYranRWcvUUQ2bk2NVL1</loc>
            <lastmod>2026-05-03T00:06:47.226Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ensemble-of-small-models-for-data-selection/paRX04EW6yK0CkBXjJLe</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/automatic-data-generation-for-instruction-fine-tuning/paxfXjNVJUawoXPjoI5u</loc>
            <lastmod>2026-05-01T01:25:20.689Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-preparing-data-to-teach-a-model-how-to-translate-french-legal-text-into-english-each-/pbH3TAXnyQdutYtAAghN</loc>
            <lastmod>2025-09-28T19:43:09.619Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/general-language-modeling-objective-based-on-joint-log-probability/pcjsQdT1eX4x4UWMcSTA</loc>
            <lastmod>2025-10-06T23:12:27.137Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-is-developing-a-new-instruction-following-model-and-is-considering-different-ways-to-/pdP6RDElLr8z7DXeBSME</loc>
            <lastmod>2026-02-08T14:32:28.856Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/aspect-based-sentiment-analysis/pdkyCdTz6CVC8jjSEdsc</loc>
            <lastmod>2026-05-02T23:58:11.036Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-a-pre-training-objective-for-a-regulated-enterprise-assistant/pe2w0JkNVj0ELhXzP3n7</loc>
            <lastmod>2026-06-12T17:55:01.922Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/true-or-false-if-an-ai-development-team-could-create-a-massive-perfectly-labeled-dataset-covering-a-/peW6PLRGPyTqV5tvjoOp</loc>
            <lastmod>2025-10-07T11:00:55.582Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-a-target-policy-distribution/pffjy13Bzof2SzknF2MM</loc>
            <lastmod>2025-10-08T15:40:59.708Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/maximum-likelihood-estimation-mle-objective-in-supervised-language-model-training/pi8sNrJs5j3Sy2sc8jJD</loc>
            <lastmod>2026-06-22T21:49:48.671Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-ambiguous-ai-training-objectives/pkL61l9l3rpbJZqTWUga</loc>
            <lastmod>2025-10-06T11:13:35.381Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-instruction-fine-tuning-the-models-training-objective-is-to-maximize-the-probability-of-the-e/pl77df4V5CPbLB0uYMrl</loc>
            <lastmod>2025-10-10T08:26:21.498Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-the-similarity-function-in-soft-prompt-optimization/prINXs0uI5a3AkxMMJY5</loc>
            <lastmod>2025-10-03T22:12:18.700Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-alignment-challenges-in-a-global-chatbot-project/prRJLEe0vyk4ZTpQUbfd</loc>
            <lastmod>2025-10-02T08:16:35.632Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-fine-tuning-a-large-language-model-using-a-reinforcement-learning-objective-that-includes-/prwoDS5ZXSY195ZA1cZD</loc>
            <lastmod>2025-10-03T20:46:00.229Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-develops-a-set-of-highly-effective-learnable-instructions-for-a-language/ptDPzmWBmrO0OHhoYinH</loc>
            <lastmod>2025-10-01T18:52:17.830Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-an-llm-alignment-failure/pw8RZuG4MZVbyADP2YV6</loc>
            <lastmod>2026-02-08T13:31:58.372Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/architectural-adaptation-of-llms-for-long-sequences/pwVyi3R2EoLodbjTqPVg</loc>
            <lastmod>2026-05-05T22:55:50.177Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-training-method-for-a-high-stakes-application/pzi8Lc77BK76BROJQ88f</loc>
            <lastmod>2025-10-10T04:27:21.930Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-training-a-large-language-model-to-generate-creative-stories-increasing-the-freque/q0qUfwLSKzStWaWqfmav</loc>
            <lastmod>2025-10-06T01:00:30.324Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-derivation-showing-that-a-policy-optimization-objective-is-equivalent-to-minimizing-kl-divergen/q4NRBIGRxBOC8sOagQgW</loc>
            <lastmod>2025-09-28T19:16:31.574Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/necessity-of-further-adaptation-for-broad-instruction-following/q7lROCYqQAx9H7D7GA9K</loc>
            <lastmod>2026-02-08T13:56:26.692Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/pointwise-loss-function-for-reward-model-training/q97hdVub2qRscONUGHUI</loc>
            <lastmod>2026-06-29T06:43:07.470Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/conditional-vs-joint-probability-objectives-in-language-modeling/q9tv7CPcHIN0Yh27Ma9b</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/for-the-reward-function-defined-as-rmathbfx-mathbfy-barmathbfy-the-output-value-is-dependent-on-the-/qAZSb7jRkbee5YTjzpwQ</loc>
            <lastmod>2026-07-01T02:56:40.101Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-in-a-sequential-decision-making-process-is-at-time-step-t-and-needs-to-select-an-action-the/qAtS1TZVdp2CRiLjc1bt</loc>
            <lastmod>2025-10-07T04:40:48.283Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-building-a-large-language-model-specialized-in-generating-high-quality-python-cod/qChY4O4xOT7C4BHb4nF9</loc>
            <lastmod>2025-10-06T11:41:16.527Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/segment-based-reward-score-formula/qEVieU0qxSKoZJYHlrcG</loc>
            <lastmod>2026-05-03T00:06:23.782Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-dataset-generation-issues/qEkN4o7BW5k69vgEdR5v</loc>
            <lastmod>2025-09-26T09:11:38.174Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-system-that-assigns-a-worth-value-to-a-response-by-taking-the-exponential-of-its-reward-score-d/qGHTpLbRyY3UQDHzd9Ea</loc>
            <lastmod>2025-10-08T16:58:13.423Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/benefit-of-a-baseline-in-a-positive-reward-environment/qGJcvDwhe31RfHOYE7FH</loc>
            <lastmod>2025-10-03T00:17:48.489Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-reward-model-scores/qI7mBFuCK1Vk6YH4RqPl</loc>
            <lastmod>2025-10-06T19:08:19.690Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-system-design-strategy/qIP8bHvFVmhX8d5fsx5V</loc>
            <lastmod>2025-10-02T20:56:34.983Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-components-in-a-maze-navigation-task/qJvvC82JvVwvMUtHW5gf</loc>
            <lastmod>2026-06-26T13:50:43.956Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-lab-has-developed-a-very-large-and-complex-language-model-that-achieves-state-of-the-art-/qMpzuAiJa2uVdpNK1Z6i</loc>
            <lastmod>2026-06-28T21:47:22.888Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-soft-prompt-optimization/qPnQYjn6xddvrx9wMkVc</loc>
            <lastmod>2025-10-06T01:04:48.985Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-company-aims-to-create-a-fine-tuning-dataset-for-a-chatbot-that-specializes-in-medical-advice-they/qROo78CtI4QMCqTM9vAp</loc>
            <lastmod>2026-02-08T14:32:30.895Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-evaluating-a-language-models-ability-to-generalize-on-the-specific-task-of-transl/qS1L1EpouWBLZdF72bvT</loc>
            <lastmod>2026-05-01T10:46:39.251Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rlhf-objective-function/qTCHZCv66XlfHPmLODJI</loc>
            <lastmod>2026-05-01T15:34:16.359Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critiquing-a-synthetic-data-generation-method/qUocXpkWUh8gGg3D0H5y</loc>
            <lastmod>2025-10-06T20:26:58.337Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-task-where-a-language-models-response-is-divided-into-segments-and-each-segment-is-classi/qWvkYjkAvcH2SfUQackn</loc>
            <lastmod>2025-10-07T08:13:35.843Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-models-capability-to-perform-well-across-a-variety-of-different-tasks-is-formally-assessed-using-t/qY32lQ08b10Aoc0bBLVR</loc>
            <lastmod>2026-05-01T10:47:02.097Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-model-produces-a-probability-distribution-q-over-a-set-of-outcomes-aiming-to-appr/qa48i0o7l7TbEY3O9e9A</loc>
            <lastmod>2025-09-28T12:50:35.267Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-language-model-has-been-fine-tuned-on-a-variety-of-instructional-tasks-match-each-of-the-fol/qcmHMRKddzDEB6kUvojZ</loc>
            <lastmod>2026-02-08T14:04:51.175Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-gradient-calculation-in-a-learning-agent/qdD0SpbVN59CmYdPfK0C</loc>
            <lastmod>2025-10-07T04:33:40.777Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/regularization-in-rlhf-reward-model-training/qe7LMAVlh9gMz0RokZHc</loc>
            <lastmod>2026-05-02T23:48:06.993Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-context-of-proximal-policy-optimization-the-gradient-of-the-objective-function-is-zero-at-the/qhrwO3O2BhrBKe6MhACz</loc>
            <lastmod>2025-10-06T03:06:51.698Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-value-alignment-refusing-harmful-requests/qiGmf7AqOxf7txyRD23g</loc>
            <lastmod>2026-02-17T18:46:52.586Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-wants-to-improve-their-large-language-models-ability-to-handle-a-wide-variety-of-/qjhNDbH7RZfhYr89x6Zq</loc>
            <lastmod>2025-09-28T21:57:28.388Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-prompts-for-a-text-summarization-task-they-provide-annotators-with-examples-of-/qmmnLM0SNWPCiLtESMZH</loc>
            <lastmod>2025-10-02T07:32:05.849Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-financial-services-company-uses-a-large-language-model-to-analyze-investment-reports-for-each-anal/qnOGqDweElXpFwVyaQtj</loc>
            <lastmod>2025-09-26T02:26:59.576Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-inconsistent-labels-on-reward-model-training/qndLgpL3zpTrNzIb8FEd</loc>
            <lastmod>2025-10-05T19:12:37.012Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/direct-preference-optimization-dpo-loss-function/qoaTEB9EaYT2XKsIKeon</loc>
            <lastmod>2026-05-03T00:58:10.115Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/use-of-proximal-policy-optimization-ppo-in-rlhf/qpOLpf84iCNR5hoh039m</loc>
            <lastmod>2026-07-03T01:17:11.027Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-startup-is-aligning-a-new-ai-financial-advisor-using-preference-feedback-the-data-is-collected-exc/qpPsrGCuT5CdjwuN1Ir0</loc>
            <lastmod>2025-10-03T01:25:34.039Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-output-sets-for-human-feedback/qpfjccDOlZAdGpJjeTNr</loc>
            <lastmod>2025-10-06T19:57:52.876Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/refinements-and-alternatives-to-rlhf/qpqKTaqm3pqAVX3K3RtZ</loc>
            <lastmod>2025-10-06T23:22:12.220Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-scenario-with-the-specific-challenge-of-manual-instruction-design-it-best-illustrates/qqh9VM8S7nthTKVI7xjp</loc>
            <lastmod>2025-10-06T20:29:53.423Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-to-go/qqkGiYx3htZhUmaiXHTi</loc>
            <lastmod>2025-10-08T13:40:14.822Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autonomous-agent-is-being-trained-to-navigate-a-maze-the-agents-decision-making-process-at-any-gi/qri3vbwxoRYhfySDoiH4</loc>
            <lastmod>2026-06-28T20:44:33.624Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/learning-to-rank-approaches-for-human-preference-modeling/qrlg0XrGJkKYf7xM9LwE</loc>
            <lastmod>2026-05-02T23:31:41.033Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyze-the-following-product-review-and-match-each-identified-product-feature-aspect-with-the-senti/quucJdpVTlO8iuYBQX62</loc>
            <lastmod>2025-10-07T12:04:48.883Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/negative-mean-squared-error-objective-for-pointwise-reward-models/qvJBREUYl65dJv6gEXA1</loc>
            <lastmod>2026-05-02T23:49:05.841Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/challenge-of-finding-a-superior-supervisor-for-strong-llms/r1IpJH0uopx43mw1iCNX</loc>
            <lastmod>2026-05-01T14:47:39.608Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/refining-a-specialized-code-generation-model/r26CuJsPan2AhImbGdrk</loc>
            <lastmod>2025-10-06T12:57:30.418Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-reward-function-for-story-generation/r2OJgptKRgj26JPFOlfO</loc>
            <lastmod>2026-06-26T06:35:29.204Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-needs-to-use-a-language-model-to-automatically-sort-customer-feedback-into-three-categor/r2P4GeCK3RxLujM8JcGO</loc>
            <lastmod>2025-09-26T08:04:42.452Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-interacts-with-an-environment-over-a-sequence-of-four-time-steps-the-rewards-it-receives-at/r31X6fPV42mNGXpXiwk7</loc>
            <lastmod>2025-10-04T02:47:25.019Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-formula-for-a-reward-weighted-probability-distribution-pimathbfymathbfx-fracpithetatextrefmat/rALJEY7DOdz5fMaB93Ls</loc>
            <lastmod>2025-09-28T22:50:49.546Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-loss-masking-in-sft/rBEMq5wV2M2pZbzXqUIy</loc>
            <lastmod>2026-05-01T00:03:00.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-soft-prompt-performance/rCvPMH41puZS1ilyg8Pd</loc>
            <lastmod>2025-10-03T22:10:40.615Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/strategic-use-of-synthetic-data-in-llm-pre-training/rEFFqIrQcrPGxCuGCBVU</loc>
            <lastmod>2025-10-03T01:54:50.705Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-implementation-analysis/rFEO42rzEuPs0rfSyTsW</loc>
            <lastmod>2025-10-06T21:16:42.029Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/necessity-of-post-pre-training-alignment/rHF5ndmUfGVdUyad08Pr</loc>
            <lastmod>2026-04-30T23:05:10.422Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/proven-utility-of-synthetic-data-in-well-tuned-llms/rIbUu1vfKIuMWhwjNi27</loc>
            <lastmod>2026-05-01T10:19:50.650Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/averaging-outputs-as-a-method-for-combining-reward-models/rJMUcM93Xxxss5P0VjPF</loc>
            <lastmod>2026-05-03T00:19:22.793Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ease-of-generating-fine-tuning-data-from-existing-nlp-tasks/rPKOFMeDHD6xTG6YMImK</loc>
            <lastmod>2026-05-01T01:06:00.570Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-instruction-tuned-models-behavior-can-be-formally-represented-as-a-conditional-probability-distri/rTp7hwg1WV9k28fVtQE0</loc>
            <lastmod>2026-02-08T14:18:30.761Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agents-experience-over-five-time-steps-is-recorded-as-the-following-multiset-of-state-action-pair/rVQJCZ6z2FBSdjl1TOFX</loc>
            <lastmod>2025-10-04T10:02:17.026Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/hinge-loss-for-binary-classification-in-reward-model-training/rWhXRWQzwNSNS93rA3xE</loc>
            <lastmod>2025-10-07T00:00:45.425Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-human-annotation-challenge-long-document-analysis/rWv2IsVsdbMIzHG4Tx7f</loc>
            <lastmod>2025-09-16T19:04:34.554Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-is-designed-to-improve-the-quality-of-its-generated-responses-at-inference-time-without-alt/rX8DavePa8OjkpixEJrv</loc>
            <lastmod>2025-10-06T16:15:09.518Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/steering-language-model-output-for-slogan-generation/rXvUf4KjDW8UhmFScv1A</loc>
            <lastmod>2025-10-09T00:15:36.834Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-used-to-generate-a-quality-score-for-a-piece-of-text-the-text-is-composed-of/rYqUaKGKW40yqgiFoEBu</loc>
            <lastmod>2025-09-26T09:50:31.635Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/trade-offs-in-human-feedback-collection-methods/rZ75KkZ4M529yFMCzAhu</loc>
            <lastmod>2025-10-10T07:46:20.285Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-model-behavior-under-maximum-likelihood-estimation/rcfje9fSvwYsUfDQNuAS</loc>
            <lastmod>2025-10-08T21:34:02.700Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-using-an-interactive-real-time-feedback-system-to-continuously-train-a-lan/rdUhsCId8s515gtipx40</loc>
            <lastmod>2025-10-06T22:35:55.825Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/justification-for-policy-gradient-simplification/re482GDWAJ1Gc1oflssG</loc>
            <lastmod>2025-10-07T11:04:21.845Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/visual-diagram-of-cascading-inference/rmleNdW1izpKqdGOEV8G</loc>
            <lastmod>2025-10-10T02:18:16.734Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-training-a-large-language-model-to-be-a-helpful-assistant-they-initially-u/ro02z4L5Twk4H9VXXKa4</loc>
            <lastmod>2025-10-03T01:32:07.880Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-adapting-a-large-language-model-for-a-highly-specialized-medical-diagnosis-task-t/rtUekefLzn8C924hd4A1</loc>
            <lastmod>2025-10-05T23:27:15.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-generalization-evaluation/rv3c1Dw3hJ2WZQiu3duR</loc>
            <lastmod>2026-02-08T14:18:04.254Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/techniques-for-enhancing-prompt-effectiveness/rxyB54ujdbQR9xLdG34N</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/unexpected-capabilities-of-a-fine-tuned-chatbot/rzY9lvkhN07ZzLUzwmC4</loc>
            <lastmod>2025-10-05T18:06:04.034Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-fine-tunes-a-large-language-model-on-a-massive-dataset-composed-exclusively-of-hi/rzeYLwdMOezHhJm93Jao</loc>
            <lastmod>2025-10-06T11:35:50.412Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/normalizing-a-function-to-create-a-probability-distribution/s0UKVTVpUypcbWEVanC2</loc>
            <lastmod>2025-10-10T06:30:06.377Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/stabilizing-policy-gradient-training/s1ZkzNyShZOF8PYQDl4J</loc>
            <lastmod>2025-10-08T14:35:15.332Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-human-evaluator-is-comparing-pairs-of-ai-generated-responses-for-two-different-user-requests-reque/s1sXQgCfva8NPD69JLt7</loc>
            <lastmod>2025-10-02T06:12:21.473Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-small-model-data-filtering/s21Y0rGDrL8jcuH3j6Ps</loc>
            <lastmod>2025-10-10T06:36:26.446Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/tuning-a-generative-model-for-different-tasks/s2SvoUc6z06ySHKAIesC</loc>
            <lastmod>2025-10-07T09:15:20.536Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-example-of-a-large-language-models-output-with-the-primary-source-of-misalignment-it-demo/s301chrnOkcLRlmQyRAq</loc>
            <lastmod>2025-10-06T03:12:48.179Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-fine-tuning-a-large-language-model-using-a-reinforcement-learning-algorithm-the-train/s5L9gfr8Un7czLZIqiTO</loc>
            <lastmod>2025-10-06T03:54:20.512Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/value-model-update-frequency-in-rlhf/s8xRDUnky37skrbmL60h</loc>
            <lastmod>2025-10-07T10:10:33.206Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-dialogue-model-engaged-in-a-three-turn-conversation-represented-by-the-sequence-x-y-x-y-x/s9uAikEnxbs9gCQvFpIx</loc>
            <lastmod>2025-09-28T13:50:11.592Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/correcting-imbalance-in-synthetic-medical-data-generation/sAa07dsBLqWBbJcY0zL8</loc>
            <lastmod>2025-10-05T19:10:32.968Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-data-scientist-is-calculating-a-topical-relevance-score-for-a-collection-of-five-news-articles-fir/sBJyYeVqLL0Ge7f7z9Wy</loc>
            <lastmod>2026-06-29T00:10:07.011Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-is-constructed-by-taking-a-large-pre-trained-language-model-and-adding-a-new-linear-l/sDwfkZunrEhwT600sC8r</loc>
            <lastmod>2025-10-07T08:06:10.914Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-a-flawed-reward-model/sEVIxnNHPeZ6ziHdIsqb</loc>
            <lastmod>2025-10-07T11:45:59.538Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-annotation-guidelines-for-prompt-creation/sHYMzTuQzN0vnSCOPI9O</loc>
            <lastmod>2025-10-06T02:23:02.380Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-training-a-soft-prompt-to-replace-a-lengthy-context-c-they-use-the-fo/sHwqvgheKiCbIbRJrvZT</loc>
            <lastmod>2025-09-26T16:10:51.183Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-model-loss-as-negative-log-likelihood/sISU6JrHZ45QL9PI8t4G</loc>
            <lastmod>2026-06-29T04:38:16.845Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-a-financial-data-extraction-prompt/sJitIg3wf6hlhJxYQ4AE</loc>
            <lastmod>2025-10-06T21:06:18.225Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-the-mathematical-description-of-a-model-fine-tuning-process-different-symbols-are-used-to-represe/sNQLcUjDMthjS0mjnWMt</loc>
            <lastmod>2025-10-03T05:58:12.992Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-a-student-models-training/sOLClFm43VKEpxiC1xr0</loc>
            <lastmod>2025-09-29T12:23:36.562Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-inefficient-language-model-training/sOcW9FMYrJhHDpOF3BQZ</loc>
            <lastmod>2025-10-07T09:00:08.745Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-an-llm-alignment-process/sPZMOHXhrbb2lKxOXAl5</loc>
            <lastmod>2025-10-02T08:10:15.969Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-scoring-reasoning-paths-by-counting-correct-steps/sSBSL7UFf4c6SsokNAxs</loc>
            <lastmod>2026-05-03T15:03:16.322Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-machine-learning-model-the-performance-score-on-the-training-data-is-represented-by-strain-and-/sUp7FkEzvvsEfTZdMkf8</loc>
            <lastmod>2026-06-29T21:01:57.589Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/objective-function-as-expected-cumulative-reward-performance-function/sWEx31zLQrIrbMbdlkiJ</loc>
            <lastmod>2026-06-29T07:14:54.434Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-reinforcement-learning-the-standard-on-policy-objective-is-defined-as-the-expected-reward-under-t/sX33k2giZGlOPulxXIjB</loc>
            <lastmod>2025-09-28T21:58:14.182Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-policy-update-for-a-chatbot/sZgRq5GfhrSvA45zpxSt</loc>
            <lastmod>2025-10-03T20:37:09.623Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-using-a-two-stage-process-to-train-a-very-large-model-they-start-with-a-massive/saqIf6CpSd1oFEoD9DEx</loc>
            <lastmod>2025-10-06T11:18:26.030Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/log-probability-of-a-ranked-sequence/sgXLeD2hFJHVSyr62FZ2</loc>
            <lastmod>2026-05-02T23:29:36.030Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fine-tuning-as-a-mechanism-for-activating-pre-trained-knowledge/sgz2w5530MMYUEQPh62D</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-outlining-the-data-flow-for-an-architecture-that-processes-a-single-input-using-/siUNIMKJghFNzGBZW68d</loc>
            <lastmod>2025-10-10T06:56:11.192Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-provides-a-language-model-with-the-following-original-text-and-a-specific-set-of-instructions/sjKuiui83tlc5GXv64np</loc>
            <lastmod>2025-10-01T21:44:45.772Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/optimizing-a-chatbot-for-user-engagement/smLsyGulvKAPn7B0lCMX</loc>
            <lastmod>2025-10-07T10:53:12.083Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-formula-for-the-policy-gradient-estimate-with-a-baseline-fracpartial-jthetapartial-thet/smj0RCrVidB0T7wsdiap</loc>
            <lastmod>2025-10-03T19:54:36.399Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-system-where-a-function-s-processes-a-series-of-k-calculated-average-vectors-denoted-barm/smwlsvR4TywynFj0krPz</loc>
            <lastmod>2026-06-30T07:51:32.715Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-a-positive-reward-function-rmathbfx-mathbfy-barmathbfy/soXhwMBqc4BpwrPORaf3</loc>
            <lastmod>2026-07-01T02:56:43.365Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-in-a-state-s-and-must-choose-between-two-policies-policy-a-and-policy-b-the-sequence/sokeFrGOud8E6kYS4tzF</loc>
            <lastmod>2025-09-26T03:11:58.783Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-an-llm-alignment-strategy/spKlJDZc3pJDzDxIEtvU</loc>
            <lastmod>2026-02-08T13:19:59.048Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-using-an-iterative-method-to-generate-a-large-dataset-for-fine-tuning-a-language-model-sta/sq8hMdCrdv5W9B1gwmKJ</loc>
            <lastmod>2025-10-05T21:11:20.379Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-preparing-data-to-train-a-language-model-for-english-to-french-translation-you-have-a-templa/sr2lqCOXAH3phD3rOPu4</loc>
            <lastmod>2025-09-26T07:14:03.206Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/trust-region-in-reinforcement-learning-optimization/svGdt2lED6BnszwjkcQ1</loc>
            <lastmod>2025-10-06T23:49:51.179Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/efficiency-benefits-of-data-selection-in-fine-tuning/sxZWUm0RgQkSYsIf4fbr</loc>
            <lastmod>2026-05-01T10:29:51.668Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-a-reward-model-on-segment-level-scores-via-regression-loss/syXmUERBfAdoL6eGahU3</loc>
            <lastmod>2026-05-03T00:08:31.934Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-task-specific-model-adaptation/t2l64hXOJ6sGGuL540jG</loc>
            <lastmod>2025-10-09T01:22:29.989Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-policy-model-behavior/t6jlixE5FdOHWsna77Sp</loc>
            <lastmod>2025-10-08T13:19:31.222Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/on-policy-objective-function/t8oyFOYpnDambLfzN4CJ</loc>
            <lastmod>2026-06-29T07:14:57.532Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/differentiating-bottlenecks-in-long-sequence-llms/tAkXHEJeYiPm7cL903La</loc>
            <lastmod>2025-10-06T23:13:44.670Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-model-is-designed-to-assess-the-similarity-between-two-user-generated-playlists-f/tC9avMkvDkuRoitDKcCQ</loc>
            <lastmod>2026-06-29T00:10:07.011Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/token-level-conditional-log-probability-in-supervised-fine-tuning/tDkIsCUOBXqzSBVBkpiQ</loc>
            <lastmod>2026-04-30T23:50:00.559Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-weak-to-strong-objective-function/tEwY2d2HFCSJTKmugDna</loc>
            <lastmod>2025-10-06T00:09:39.832Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/derivation-of-dpo-preference-probability-from-policy-ratios/tFyp9oF3fg3LEsj5MkIS</loc>
            <lastmod>2026-05-03T00:58:01.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-has-just-finished-pre-training-a-language-model-using-a-two-part-system-the-/tGQOaJaOvyX1pgSk9aRo</loc>
            <lastmod>2026-04-26T18:31:40.148Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-prompt-engineering-problem-scenario-with-the-most-appropriate-solution-approach/tMsa7yhGIa3F364CpyYJ</loc>
            <lastmod>2025-10-06T20:39:10.440Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-a-financial-advisory-system/tMyHSDEA8icOMcIIrtJL</loc>
            <lastmod>2026-04-30T13:36:15.409Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-training-a-reinforcement-learning-agent-to-process-text-the-agent-receives-a-single-s/tOUHNt9n7wyspjHlrq5r</loc>
            <lastmod>2025-09-28T22:30:52.737Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-refining-a-language-model-using-two-distinct-methods-in-method-a-they-train-the-m/tPAot6uFmd0edMrZU9ys</loc>
            <lastmod>2025-09-28T17:11:43.417Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-wants-to-translate-a-sentence-from-english-to-chinese-using-a-large-language-model-which-of-t/tPV9C7aD2Mj55QQKlE7k</loc>
            <lastmod>2025-10-04T22:20:02.423Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/task-pool-in-self-instruct/tQprx8M7V6d48osWqKNx</loc>
            <lastmod>2025-10-07T00:03:52.298Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-model-is-designed-to-assess-the-overall-quality-of-a-three-paragraph-product-revi/tUnvjwB8tLNlZkh5xtpJ</loc>
            <lastmod>2025-09-28T16:31:28.766Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-an-agents-suboptimal-policy/tWMaDI4rn86De5asGNwJ</loc>
            <lastmod>2025-10-08T23:01:44.538Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-model-behavior-via-the-objective-function/tXGBBHUTUFnh8yy5kfYz</loc>
            <lastmod>2026-06-26T15:39:47.223Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-sequence-generation-model-is-being-trained-using-a-policy-gradient-method-at-a-specific-step-t-the/tZ17xe9E6iDJFpinfW17</loc>
            <lastmod>2025-10-02T02:10:57.781Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/multi-objective-optimization-for-policy-training-with-multiple-reward-models/tZ7O0pSgwo4Hynz7Ph9a</loc>
            <lastmod>2026-05-03T00:24:03.859Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/instruction-fine-tuning-as-a-sample-efficient-method/taNAjJCkBliyxJ5X0EKL</loc>
            <lastmod>2026-05-01T10:36:34.768Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/restaurant-review-analysis/taehPf7TOq8yBKd3Zz3t</loc>
            <lastmod>2025-10-02T07:45:11.381Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-prompt-for-support-ticket-routing/tbh49pXFqIiFBVzO7VZ7</loc>
            <lastmod>2025-10-02T08:49:49.983Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-data-science-team-is-evaluating-the-effort-required-for-several-potential-data-annotation-projects/tdV2PMTbXptOP8BOBlRb</loc>
            <lastmod>2025-10-10T08:27:12.635Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/function-to-measure-differences-between-models/te6RkfdDgBmqql6sZuw2</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-refining-a-reward-model-by-segmenting-long-user-chatbot-interactions-they-use-/thNzU201rUeYPJ6irQYX</loc>
            <lastmod>2025-10-05T18:21:34.701Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-an-agent-interacting-with-an-environment-over-a-single-episode-the-future-return-is-calcula/themLnUj1SUY6YxjxTqM</loc>
            <lastmod>2025-10-07T09:37:46.058Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-model-deployment-strategy/timBDisMY99boeWG5TAO</loc>
            <lastmod>2025-10-05T17:24:03.882Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-fine-tuning-a-language-model-using-a-reinforcement-learning-pipeline-guided-by-hu/tkCYzJvyRWx1Gilp4VLt</loc>
            <lastmod>2025-10-10T06:21:35.066Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/balancing-general-and-specific-knowledge-in-model-training/tn1ps8qpmJYW9ObybE0Z</loc>
            <lastmod>2025-10-06T19:27:13.743Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-engineer-is-building-a-system-to-generate-a-single-quality-score-for-a-models-text-response-based/tot83J2XDphbTQpHEXz3</loc>
            <lastmod>2025-10-02T03:45:53.545Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagram-of-reward-score-calculation-using-an-llm/tpjnqZHEJ421Xlrj9jp1</loc>
            <lastmod>2026-06-23T19:04:34.965Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-preference-based-llm-alignment-project-your/trr8Mn9iQDsNoFsanJbt</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ac-actor-loss-function/tsRhtRDNkL3Jnc9DEuMl</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-team-has-developed-a-single-complex-predictive-model-while-it-performs-well-on-av/twx0tMFi5Tv8HbTGYxCb</loc>
            <lastmod>2025-09-28T15:56:27.466Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-language-model-to-act-as-a-programming-assistant-their-initial-t/tynhWqCINe2CLNa1JVOJ</loc>
            <lastmod>2025-10-03T04:05:26.984Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-preference-data-for-ai-training/tz8mVKw94o5gJSBBJjCD</loc>
            <lastmod>2025-10-02T20:40:38.190Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/state-evolution-in-token-generation/tzxNCaUotSY5ajxCQFfr</loc>
            <lastmod>2025-10-10T01:46:34.496Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-feedback-as-an-alternative-to-human-feedback/u25F4lXo3ct4S0DFp5GK</loc>
            <lastmod>2025-10-07T00:18:24.034Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-interplay-of-overfitting-and-knowledge-loss-in-model-tuning/u2n9PVv2Y0QzoUvMFhC8</loc>
            <lastmod>2025-10-06T20:12:19.675Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-using-an-inference-time-technique-to-improve-the-quality-of-its-models-res/u360wdR2keInhD6dI2OE</loc>
            <lastmod>2025-10-07T11:16:44.448Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-robotic-vacuum-cleaner-is-learning-to-clean-a-room-more-efficiently-it-uses-a-camera-to-see-the-ro/u3vEgSSody9VE2zztHtg</loc>
            <lastmod>2025-10-06T11:24:05.692Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-sft-and-pre-training-datasets/u4mfP9IE6oiU46myor3G</loc>
            <lastmod>2025-10-10T08:23:25.881Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-building-a-fine-tuning-dataset-to-make-a-language-model-a-safe-and-helpful-ass/u52CpI3T6p73BGBf9yj2</loc>
            <lastmod>2025-09-26T04:51:49.764Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-llms-to-generate-fine-tuning-data/u6LUHnrwZkR4sMNtuGSG</loc>
            <lastmod>2026-06-22T21:49:48.445Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/youre-reviewing-a-teammates-claim-about-a-new-pe/u7ZuxmuIM5eIR982vy0u</loc>
            <lastmod>2026-02-06T18:02:20.893Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-alignment-methodologies/u8wN009Gn09S7L5VI5KW</loc>
            <lastmod>2025-10-06T23:22:04.839Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-as-the-agent-in-rlhf/u9FrAcfHhtbhf9bZllym</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/adjusting-the-distillation-loss-coefficient/uAftgIml2aXcFDXvtNF3</loc>
            <lastmod>2026-05-01T15:16:45.569Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/soft-prompt-learning-as-context-compression-via-knowledge-distillation/uBbLE0mxM4CtJaqj5ffE</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/state-value-function-as-a-baseline/uBfWdUEQe3qTYmFu8RCm</loc>
            <lastmod>2025-10-07T00:21:11.816Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-the-following-interaction-with-a-language-model-turn-user-what-are-the-main-tourist-attract/uCkEQ5SSU9Ew7Tt3qjtc</loc>
            <lastmod>2025-09-28T23:08:51.442Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-a-reward-models-input-formulation/uENRs2huJwhaaPw8UlDZ</loc>
            <lastmod>2025-10-10T06:43:17.460Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/unit-reward-function-for-segments/uEWKQg3FjWEIlvEBgL8s</loc>
            <lastmod>2026-06-29T07:25:00.019Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/efficient-prompting/uEkEpj4Sm1R81ICGoUkY</loc>
            <lastmod>2025-09-16T14:55:35.244Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/selecting-a-data-source-for-a-qa-ai-assistant/uFCprya1Y9oDxwNGZMmU</loc>
            <lastmod>2025-09-28T14:04:32.487Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-role-of-a-baseline-in-model-evaluation/uFJVe1ztfvzvOYKsA0XM</loc>
            <lastmod>2025-10-08T13:11:39.015Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critiquing-a-sentiment-analysis-output/uGAP5QRY4FiQCU7UzoWq</loc>
            <lastmod>2025-10-04T07:10:02.670Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-developer-provides-the-exact-same-input-to-two-different-large-language-models-model-a-is-a-ba/uKS9DC8xqmezbz5T9MV8</loc>
            <lastmod>2025-09-29T12:26:39.331Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-agent-is-being-updated-from-a-particular-state-the-original-reference-version-of-the-agent-had/uOUtSPy980MexNg1f0gt</loc>
            <lastmod>2025-09-26T02:28:21.147Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/error-analysis-in-fine-tuning-data-preparation/uPW3zFFXJ0yhiNWJYspH</loc>
            <lastmod>2026-05-01T00:56:27.293Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/plackett-luce-selection-probability-formula/uQ4Mt7ploZXXaiXJy4Vi</loc>
            <lastmod>2026-05-03T09:56:29.453Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-off-the-shelf-llms-as-reward-models/uQEDS22Bn44xKDpX8JVd</loc>
            <lastmod>2026-05-03T00:25:03.719Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-advantage-estimation-in-ac/uQksYfd14tlTNIJ8E3Jj</loc>
            <lastmod>2025-10-06T13:18:06.733Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyze-the-following-detailed-instruction-for-a-language-model-your-objective-is-to-create-a-conver/uQnU4OJ4TSg5o2xE0BQO</loc>
            <lastmod>2025-10-05T17:21:16.100Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-deletion-based-simplification/uSXatUSoqzAEFKUNR33h</loc>
            <lastmod>2025-10-07T11:19:30.598Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ensuring-quality-and-diversity-in-generated-preference-data/uTqKYBVb6eYB6SyECBNq</loc>
            <lastmod>2026-05-03T01:11:03.151Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/data-selection-and-filtering-using-small-models/uU8oAEizlmXrSkUZQNWL</loc>
            <lastmod>2026-05-01T15:44:29.579Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-researcher-is-optimizing-a-soft-prompt-with-the-original-long-context-the-model-predicts-the-corre/uUW83J9wE9Ib0toO8qe6</loc>
            <lastmod>2025-10-10T09:03:00.288Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-process-a-policy-is-updated-for-a-specific-state-action-pair-the-probabi/uVFG7hHvGb23G2QnVhCj</loc>
            <lastmod>2025-09-26T04:58:41.179Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impact-of-a-biased-reward-model-on-value-function-training/uWs47zC74zipeGsf5lqD</loc>
            <lastmod>2025-10-05T21:32:57.385Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/identifying-flawed-reward-metrics/uXgyA5I5t2emTf2Co2yG</loc>
            <lastmod>2025-10-07T11:42:26.931Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-reformulation-using-advantage-function/uYokciMG2QpsGhuuPHA3</loc>
            <lastmod>2026-05-17T18:02:07.587Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/informal-definition-of-intra-task-generalization/uZ5lHz8rSQ2sTXB8KZXY</loc>
            <lastmod>2026-06-29T07:28:53.062Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/achieving-instruction-following-with-minimal-fine-tuning-data/uZEIm04McPfngW5cg7Yt</loc>
            <lastmod>2026-05-01T10:34:57.077Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-adapting-a-large-powerful-language-model-the-strong-model-for-a-specialized-task-/uZyggzyE7uT0rCZ0PvKu</loc>
            <lastmod>2025-09-28T23:42:35.482Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-model-performance-with-hinge-loss/ucNOFwDe8HL7Yt2W1Szp</loc>
            <lastmod>2025-10-04T03:01:29.432Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-aligning-a-new-large-language-model-their-sole-strategy-is-to-use-a-reward-mod/ucR3J5RVW4d55729N3ki</loc>
            <lastmod>2025-10-02T11:38:47.623Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-system-that-utilizes-an-ensemble-of-reward-models-to-generate-a-final-reward-signal-what-is-the/ue287BVPbkzanFWWzWxk</loc>
            <lastmod>2025-10-02T19:44:23.979Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-a-suboptimal-agent-policy/ue5H0VJOrHl0IS2485uM</loc>
            <lastmod>2025-10-03T01:48:53.967Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-sequence-generation-model-being-trained-with-a-policy-gradient-method-if-the-advantage-fu/ufmwDtIY6nJzSPqzyv7G</loc>
            <lastmod>2025-10-08T23:23:36.184Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-generalization-within-a-task/ugO9fcE06WC5CFnTecyv</loc>
            <lastmod>2026-05-01T10:46:47.531Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-function-in-reinforcement-learning/uiCoffUkbSjNr4Gejz8u</loc>
            <lastmod>2026-05-01T15:56:51.053Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/examples-of-instruction-following-tasks-in-sft-datasets/uiiha40LHQPpTVGxX8x7</loc>
            <lastmod>2026-02-08T14:11:45.610Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/temporal-difference-td-error-as-an-advantage-function-estimator/uj3ZBdbiTAz8uy697nUR</loc>
            <lastmod>2026-05-17T20:53:15.841Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-rlhf-tuned-language-model-has-generated-the-partial-sentence-the-best-way-to-learn-is-by-the-mode/ukc51hbYNm38D6lDHSiY</loc>
            <lastmod>2025-10-06T11:38:16.372Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ensemble-learning-techniques-for-reward-model-creation/ulahNUEy0MfYWCCZQoYA</loc>
            <lastmod>2026-05-03T00:24:21.556Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-a-policy-update-using-a-clipped-surrogate-objective-the-advantage-for-a-specific-token-is-cal/ulscuWvAtOlk9l6APuuQ</loc>
            <lastmod>2025-10-03T21:15:30.780Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-gradient-estimation-from-sampled-trajectories/uoDTlrhSJtLmeoTBBF50</loc>
            <lastmod>2025-09-29T12:01:59.877Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/troubleshooting-a-vague-financial-prompt/uoYAqmfdPAqLExILtBfJ</loc>
            <lastmod>2025-10-05T12:39:40.776Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-training-process-where-a-sequence-of-special-trainable-numerical-representations-is-prepe/up99wIwSQl0jCfIOgWbr</loc>
            <lastmod>2025-09-26T06:24:12.461Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-system-uses-a-probabilistic-model-to-rank-three-generated-text-snippets-snippet-a-snippet-b-an/upD7xQSPg4ddfByQyDjH</loc>
            <lastmod>2025-10-03T19:30:40.402Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/components-of-a-prompt-instruction-and-user-input/upYdXf1bVnc3KJm8vJVl</loc>
            <lastmod>2025-10-07T10:11:16.960Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/justification-for-simplification-in-policy-optimization/upcprXq30WMRklpTUasl</loc>
            <lastmod>2025-10-08T22:33:14.755Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-sft-efficiency-with-advanced-data-construction/uqC6PHpzNfP6mkh3MJai</loc>
            <lastmod>2026-05-01T00:46:36.165Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/generating-preference-data-using-llms/uqN0GLEMpuXMMpCxSIUu</loc>
            <lastmod>2026-05-03T01:04:44.802Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-is-being-trained-in-a-specialized-environment-where-the-total-reward-/uue13K8mlFDeiWOrC63V</loc>
            <lastmod>2025-10-06T21:29:53.431Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/impracticality-of-achieving-alignment-solely-through-pre-training/uviaKHUgR7ZUiF2g6obg</loc>
            <lastmod>2026-04-30T23:03:53.296Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/error-analysis-in-a-fine-tuning-sample/uwkKy2ew5DdE3qrbc2jQ</loc>
            <lastmod>2025-10-04T06:21:04.513Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-response-worth-for-an-ai-assistant/uxYG6sdP9LxtyQvDRFf4</loc>
            <lastmod>2025-10-03T22:15:14.287Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/component-relationships-in-an-iterative-refinement-diagram/uzDYd6awB6JRFVXyespX</loc>
            <lastmod>2025-10-10T01:50:53.145Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-pointwise-methods-for-segment-level-reward-modeling/uzEIBwFdfx0VzsvYtUai</loc>
            <lastmod>2026-05-03T00:08:14.468Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-reward-modeling-strategies-for-creative-writing/v0G8qQosUgxM0PMQo6EL</loc>
            <lastmod>2025-10-10T03:54:00.605Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/symptom-duration/v0nTgdb8uDEJBb812pYh</loc>
            <lastmod>2025-09-22T06:23:10.535Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/definition-of-daylight-savings-time-dst/v2IcX0kQJUHSz6I6FmVH</loc>
            <lastmod>2026-07-11T03:35:25.806Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-framework-it-is-possible-to-compute-a-meaningful-long-term-value-functio/v2StLYxPP1fcGpBUw079</loc>
            <lastmod>2025-10-10T09:29:36.379Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sampling-in-self-instruct/v2Z6qUPrpZMlZsugsfj6</loc>
            <lastmod>2026-05-01T01:27:05.087Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-fine-tuned-on-a-dataset-of-instruction-response-pairs-consider-the-followi/v4bTQyauSJSGWcWUtyHE</loc>
            <lastmod>2025-09-28T18:45:01.060Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-user-prompt-with-the-primary-task-it-is-designed-to-elicit-from-a-language-model/v7nY45FvXhCVPRdMXUmw</loc>
            <lastmod>2025-10-10T02:51:00.076Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-fine-tuning-a-large-pre-trained-language-model-on-a-specialized-dataset-of-med/v8AsjUmIGA6syUlobASQ</loc>
            <lastmod>2025-10-06T01:30:57.620Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-sequence-generation-model-is-being-trained-to-maximize-the-objective-function-umathbfx-mathbfy-the/vD9qxPucHKPIllkLgMRC</loc>
            <lastmod>2026-06-26T15:39:47.223Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-learning-to-play-a-video-game-at-time-step-t-the-agent-performs-an-action-eg-jumping/vEk3s1Q00RJhCdDlLUCT</loc>
            <lastmod>2026-05-10T01:37:25.473Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-model-that-generates-a-sequence-of-items-one-by-one-a-function-s-is-used-to-compute-a/vFZC1nLA33XyJBIGxokn</loc>
            <lastmod>2025-10-03T21:10:16.778Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/kl-divergence-penalty-in-rlhf-policy-optimization/vFhzMDkzF98EAdzJb20f</loc>
            <lastmod>2026-07-06T10:19:13.748Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applicability-of-policy-gradients-with-discrete-rewards/vFvCdpSGGLLBOc6sRyy6</loc>
            <lastmod>2025-10-02T21:53:00.032Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/simplifying-advantage-function-calculation-in-ac/vIH61dOmucH0I2LPJ9j1</loc>
            <lastmod>2026-05-01T16:43:28.647Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/constructing-a-machine-translation-fine-tuning-sample/vJAHVeuVg3aI5EtXjvvM</loc>
            <lastmod>2025-10-04T09:22:48.172Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/human-preference-alignment-via-reward-models/vJFZsiApdsZTCHbGPzFU</loc>
            <lastmod>2026-06-26T22:34:07.095Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-generalization-across-tasks/vJKcMzds3OBdytIQGiob</loc>
            <lastmod>2026-05-01T10:53:36.721Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-training-stagnation-in-a-reward-based-system/vJrDdPe07P9amG80ky4s</loc>
            <lastmod>2025-10-03T01:26:28.486Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/paraphrasing-a-task-description-for-conciseness/vJrMXeI0rkaIdyeWezoQ</loc>
            <lastmod>2025-10-03T04:18:10.026Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-fine-tuning-a-language-model-using-a-reinforcement-learning-process-guided-by-human-feedba/vK8NeWaFhlRJ1B63is1h</loc>
            <lastmod>2025-10-05T19:42:22.567Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/during-the-final-training-phase-of-a-language-model-guided-by-human-feedback-both-a-policy-the-langu/vMiNNXPSnbDgMLeHGvxd</loc>
            <lastmod>2025-09-28T18:38:28.590Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-an-rlhf-initialization-error/vNGpWqh9yLj17yrGnGze</loc>
            <lastmod>2025-10-10T03:22:42.987Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/teacher-student-model-architecture-in-knowledge-distillation/vP2IELMzSM8y4OcbnDIB</loc>
            <lastmod>2026-06-29T07:59:11.078Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sequence-level-evaluation-in-reward-models/vPH5hyWipVXi0GBVfGn4</loc>
            <lastmod>2026-05-01T17:06:50.915Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-training-objectives-instruction-fine-tuning-vs-pre-training/vPSHDpd28E4vimVeqaTm</loc>
            <lastmod>2026-04-30T23:41:13.245Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/input-formulation-for-the-rlhf-reward-model/vRlbtRggNsfKSDRakxPl</loc>
            <lastmod>2026-04-20T10:20:23.004Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-policy-optimization-an-importance-sampled-surrogate-objective-is-often-used-to-approximate-the-tr/vVleATFBaPFRzBvtVCBh</loc>
            <lastmod>2025-09-29T03:12:05.078Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/equivalence-of-advantage-estimation-and-reward-shaping/vWU3p6r6urrWRhJ1iBRg</loc>
            <lastmod>2026-05-17T20:53:15.841Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-fine-tuning-a-language-model-with-a-reward-signal-an-optimization-method-like-proximal-policy-o/vXhLxMm4jgej8RIgPKHH</loc>
            <lastmod>2025-10-06T23:21:23.792Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-building-a-single-language-model-intended-to-serve-as-a-versatile-corporate-as/vZvwzgfPDJCjdYkzOIdP</loc>
            <lastmod>2026-02-08T14:41:28.207Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-inference-engine-using-a-continuous-batching-strategy-is-currently-processing-a-set-of-text-gener/vb0vVszXIl2ZZAPJH9tn</loc>
            <lastmod>2025-09-27T12:51:18.350Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-language-model-to-generate-detailed-multi-paragraph-explanations-of-complex-sci/ve1A2g8yI7iNB9LEUPHU</loc>
            <lastmod>2025-10-05T19:03:32.508Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/complexity-of-data-annotation-for-llms-vs-conventional-nlp/viLORmG7svw3ArMpJTiE</loc>
            <lastmod>2026-05-01T00:57:58.838Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-system-is-designed-where-a-single-input-is-processed-concurrently-by-several-independent-small-mod/vjBiswtjrgdRrsNzLEr9</loc>
            <lastmod>2025-10-09T02:32:19.066Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-startup-with-a-limited-computational-budget-wants-to-align-a-language-model-with-human-preferences/vl5mWsOSPuZR1o65LiWs</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/limitations-of-supervised-fine-tuning-for-llm-alignment/vnTlHlFWYDLnI0R5fs7o</loc>
            <lastmod>2026-05-12T16:51:39.512Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-system-where-a-single-input-is-processed-in-parallel-by-several-small-independent-computa/vqp6zFCW3zC5cEwL5wjs</loc>
            <lastmod>2025-10-02T04:51:45.191Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-human-annotator-provides-the-following-judgments-for-four-text-completions-c-c-c-c-generated-in-re/vrtNtRfKCIs4flw7QpH9</loc>
            <lastmod>2025-10-04T02:48:07.675Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-training-imbalance/vsXd2RcoGgMOD2NiiJ75</loc>
            <lastmod>2025-10-09T03:31:59.470Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/simplifying-task-descriptions-by-paraphrasing/vt5xiKJEPRQ85H8YW4ah</loc>
            <lastmod>2026-04-30T22:46:44.983Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-model-to-predict-user-preferences-between-two-generated-text-responses-the-trai/vuIn1FpcADk0wtfOeIgn</loc>
            <lastmod>2025-10-07T04:32:14.477Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sequence-of-mathematical-terms-in-angle-brackets/vw7TYJyUZWbW75QAisJB</loc>
            <lastmod>2025-10-09T00:11:33.598Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-training-strategies-for-a-robotic-arm/vwCW0Qi2leBKcFPZG3vu</loc>
            <lastmod>2026-06-17T21:33:04.789Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ppo-as-an-online-reinforcement-learning-method/vxsACiSUmCljxVQphS0j</loc>
            <lastmod>2026-05-03T01:03:32.584Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-refining-a-language-model-to-generate-more-helpful-responses-they-have-a-colle/w0pvd0ye99M4l2mgMPGd</loc>
            <lastmod>2025-10-01T21:45:26.601Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/suitability-of-instruction-fine-tuning-for-well-defined-tasks/w2U65wNQUFqWIkuC3adz</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-engineer-is-creating-a-dataset-to-fine-tune-a-language-model-to-act-as-a-helpful-/w44diDFWIHGFt2B5c6AT</loc>
            <lastmod>2025-09-26T07:30:10.025Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-model-training-strategy-for-generalization/w5U4TCGHV9xWwE1MZQ7s</loc>
            <lastmod>2025-09-29T01:02:29.880Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/approximating-expected-loss-with-empirical-loss/w6AKTEbIjK1IYXR07iiN</loc>
            <lastmod>2025-10-07T10:32:18.600Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-episode-return/w7K7uNLqEy385p5bUn9M</loc>
            <lastmod>2025-10-09T13:49:48.288Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-text-analysis-system-provides-a-single-neutral-sentiment-score-for-the-following-customer-review-t/w8GSPVn1E5fh2OVLEEJV</loc>
            <lastmod>2025-10-01T22:33:31.727Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-scenario-an-agent-in-a-specific-state-calculates-that-the-advantage-of-p/wAQS8kUhvUN3P2FeX7Qc</loc>
            <lastmod>2025-10-04T03:58:51.126Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-generating-a-sequence-by-interacting-with-an-environment-for-a-single-time-step-starting/wCabg7RSu6LZJB3apaK8</loc>
            <lastmod>2025-10-10T10:35:39.113Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-training-a-language-model-using-a-framework-that-incorporates-human-feedback-standard-reinforce/wDOcN07GHkMaG5Hy5O5y</loc>
            <lastmod>2025-10-08T13:53:01.039Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-training-a-language-model-to-provide-medical-summaries-for-doctors-they-find-that-using-a-/wDbF7K8MZmFpTdF8I8oC</loc>
            <lastmod>2025-10-07T04:28:27.827Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sample-generation-in-self-instruct/wEt4prmIBu4h2FF6K10v</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-left-the-following-review-for-a-new-laptop-the-keyboard-is-a-dream-to-type-on-and-the/wGp5idzEiN1chEZ1sU4l</loc>
            <lastmod>2025-09-26T12:29:50.694Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/justifying-a-modeling-approach-for-fact-checking/wH5FcU2f0tYFTVUvF0PX</loc>
            <lastmod>2025-10-10T06:39:42.506Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-training-a-language-model-to-act-as-a-helpful-assistant-using-methods-from-reinfo/wIQ6BqJw1B2HY8qrb5Ot</loc>
            <lastmod>2025-09-26T12:33:35.804Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-generating-a-response-to-the-prompt-the-best-way-to-learn-a-new-skill-is-to/wKO4fzt4lnnWYhPkaPi8</loc>
            <lastmod>2025-10-01T22:54:53.428Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-a-well-tuned-llm-to-generate-fine-tuning-data-for-a-new-llm/wM2htOU6qMwaGIOamhn2</loc>
            <lastmod>2026-05-01T01:13:11.595Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/segmentation-strategy-for-a-factual-qa-model/wM7EqLevAHc8VCWE3kNk</loc>
            <lastmod>2025-10-03T01:56:57.582Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-listwise-ranking-in-rlhf/wOUaYSzviX7qpIEmOzri</loc>
            <lastmod>2026-05-02T23:23:23.262Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-performance-gap-recovered-pgr/wPP5ZPRqzU3cvcUs5fgJ</loc>
            <lastmod>2026-06-28T21:53:17.812Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-classification-model-is-given-an-input-x-and-must-choose-an-output-y-from-the-set-of-possible-clas/wQ3NsUwdKRIzDbzRQx3x</loc>
            <lastmod>2025-09-26T11:48:59.045Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ppo-objective-for-llm-training/wQ8VEyVhpPWgsAHnrexi</loc>
            <lastmod>2026-07-03T01:17:10.929Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-in-the-final-stage-of-a-three-part-alignment-process-for-their-language-mo/wRT5UjVsetfeiDNCNmLO</loc>
            <lastmod>2025-10-10T04:00:42.215Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-refining-a-language-models-ability-to-be-helpful-and-harmless-they-use-two-distin/wTWJsFD4jpTxZsO6yICm</loc>
            <lastmod>2025-10-06T11:27:16.581Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/adapting-a-soft-prompt-tuned-model/wUWJiyOI9miFyLBTYBFm</loc>
            <lastmod>2025-10-10T07:44:50.102Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/early-origins-of-ai-alignment-norbert-wiener/wWuHcR79jt2IDCHKdDnB</loc>
            <lastmod>2026-05-03T15:44:36.993Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/adjusting-chatbot-behavior-via-reward-model-weighting/wXI03a7nnAJFxzoyp69z</loc>
            <lastmod>2025-10-03T21:45:51.894Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-technical-troubleshooting-prompt/wZx4Z7XLIuFJmtxdOTuw</loc>
            <lastmod>2025-10-05T17:16:43.530Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-issues-in-a-chatbot-training-pipeline/wadwYVf8zEw6hnMghf4G</loc>
            <lastmod>2025-09-28T15:30:05.596Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-machine-translation-system-and-focuses-on-word-alignment-which-invol/wboT1c9RRVLxs3Js2Ic1</loc>
            <lastmod>2025-09-28T15:04:24.063Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-missing-reward-model-dpo-implementation-and-its-offline-implications/wcNZenvfXM6GYvxBuWFb</loc>
            <lastmod>2026-05-03T00:34:19.067Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-to-navigate-a-complex-maze-it-receives-a-large-positive-reward-only-upon-r/wduesmXRYEmXU0uh9wDd</loc>
            <lastmod>2025-09-29T02:30:29.741Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparing-reward-optimization-strategies/weNARyjnUjvvRFu3mCVx</loc>
            <lastmod>2025-10-07T00:07:17.361Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyze-the-value-based-reward-shaping-formula-r-r-vst-vst-by-matching-each-component-to-its-specifi/wn0f7uS70gb0ya4BVQZC</loc>
            <lastmod>2025-10-08T21:48:31.465Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-designing-a-system-that-uses-a-language-model-to-generate-a-single-numerical-sco/wnGSbWit5lhj328lPpkL</loc>
            <lastmod>2025-10-04T17:02:41.949Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-reinforcement-learning-context-a-policy-is-updated-by-maximizing-an-objective-function-consider/wqcBHs2kcPD1jxsvHG0I</loc>
            <lastmod>2025-09-28T11:43:40.772Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/action-in-the-context-of-llms/wr4AE5Hdyb8v23rahA7s</loc>
            <lastmod>2026-05-01T15:56:33.248Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-human-feedback-strategy/wrYWs2HnYyBB1hh6SHdW</loc>
            <lastmod>2025-09-28T11:26:30.978Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-optimization-algorithm-a-ratio-comparing-the-likelihood-of-an-action-under-a-new-policy-/wtmeM90ea1VfrbnhTIFc</loc>
            <lastmod>2025-10-04T02:51:50.498Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formula-for-re-weighting-a-probability-distribution-with-a-reward-function/wty1lMBe1QDHIgeUYBU1</loc>
            <lastmod>2026-06-29T18:16:48.496Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/practical-implementation-challenges-of-sft/wy30qUsx0XNcnILLRZu5</loc>
            <lastmod>2025-10-05T13:51:05.128Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/critic-network-performance-analysis/wyOtbeB6BtI0qmJFh9dn</loc>
            <lastmod>2025-10-06T18:02:59.179Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-tasked-with-creating-a-single-piece-of-preference-data-to-help-train-a-customer-service-ai-a/wyyQI5DuUE7Awo3ArE6y</loc>
            <lastmod>2025-10-09T01:53:44.282Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-recommending-a-medical-consultation-and-offering-scheduling-assistance/x0nbUqxxqjvinlRlDbqj</loc>
            <lastmod>2025-10-05T13:30:47.201Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-pointwise-vs-relative-preference-methods-in-rlhf/x2S4whl08xINKQ8enSyp</loc>
            <lastmod>2026-02-05T22:35:15.827Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-medical-image-analysis-system/x3mEJYUZ8W7Wu7eR2LTV</loc>
            <lastmod>2025-10-05T22:19:27.425Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/contrasting-data-sourcing-methods-in-model-training/x58nGHbhWkl7CoZ9sX0W</loc>
            <lastmod>2025-10-06T12:15:30.379Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-building-a-system-to-align-a-large-language-model-using-reinforcement-learning/x7xQkkd7fmUlVJDDsh7u</loc>
            <lastmod>2025-09-26T02:31:23.111Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-component-outputs-in-text-generation/x8rCFWBE6Sh2MqgZCTrK</loc>
            <lastmod>2025-10-10T03:59:16.814Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-assistant-is-designed-to-be-a-helpful-and-harmless-conversational-partner-and-is-deployed-glob/x8xMEGi5mf9l1g2BrU8m</loc>
            <lastmod>2025-10-03T04:58:00.470Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/training-objective-for-multi-round-dialogue-models/x9lKXX2MTwDH9kM9XS0Q</loc>
            <lastmod>2026-05-01T00:40:21.733Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/learning-soft-prompts-via-context-compression/xAhXVHR86RNcQLQiCfDE</loc>
            <lastmod>2026-04-30T22:06:44.130Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-designed-to-maintain-a-coherent-conversation-with-a-user-it-processes-the-conver/xAy9DE3t6hzyXl1pclnh</loc>
            <lastmod>2025-10-02T23:05:33.108Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/identifying-spam-characteristics/xDaND28ECGuUmz0QWwJI</loc>
            <lastmod>2025-10-04T05:43:23.486Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-a-feedback-collection-strategy/xECazxyIP55tqxQ3Us8b</loc>
            <lastmod>2025-09-29T00:20:22.798Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/suitable-applications-for-the-pointwise-method-in-rlhf/xF3xGo6KSMpc21BFVZIW</loc>
            <lastmod>2026-05-02T23:49:35.905Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/examples-of-constant-segment-based-reward-functions/xK2SEQv1bFEOKJUBuBX4</loc>
            <lastmod>2026-07-01T02:56:40.101Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/constrained-prompting-for-text-simplification/xKnLanks7DNdEm0BzzOd</loc>
            <lastmod>2025-10-07T10:52:34.432Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-developing-a-system-to-generate-instructional-data-they-begin-with-a-fixed-set-of-human-wr/xKoASuPMFrthdtrEmrR2</loc>
            <lastmod>2025-10-03T03:13:24.279Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/applying-the-listwise-loss-summation/xLHO7ylnrFKmIEH0J1Cp</loc>
            <lastmod>2025-10-04T02:38:17.500Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analysis-of-a-hybrid-ai-system-for-customer-support/xMy9K6bEkZfYEWGxJfod</loc>
            <lastmod>2025-09-28T19:23:23.230Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/formulating-the-loss-function-for-policy-learning-in-rlhf/xOT0LLwOenpNJgDB6TQc</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-research-team-fine-tunes-a-large-language-model-exclusively-on-the-task-of-translating-english/xP74vOxp6LE7cZcT00xr</loc>
            <lastmod>2025-10-05T17:03:42.974Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/addressing-feedback-bottlenecks-in-chatbot-development/xShYEGMbyap0oGWVF7Qy</loc>
            <lastmod>2025-10-06T18:33:05.984Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/omission-of-parameter-superscript-in-probability-notation/xSu4bwjyDHzmDePM4VwM</loc>
            <lastmod>2025-10-06T22:04:21.109Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-successful-weak-to-strong-generalization-gpt-with-gpt-supervision/xV6AH28M7PbhrYi2OuR9</loc>
            <lastmod>2026-05-01T14:55:24.357Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-fine-tuning-a-language-model-on-a-dataset-of-instruction-response-pairs-initially-the/xXmpcy4c3otlYznCbFW8</loc>
            <lastmod>2025-10-02T05:00:39.023Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-is-refining-a-language-models-ability-to-generate-summaries-for-each-source-docum/xXshUK7Csew8gzRz85Hr</loc>
            <lastmod>2025-10-03T18:33:55.602Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-has-fine-tuned-a-large-language-model-that-excels-at-summarizing-legal-docume/xYgDC0B0G5yV5RfnzPFx</loc>
            <lastmod>2026-02-08T14:06:03.873Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-models-policy-is-designed-such-that-the-probability-of-generating-an-output-is-proportion/xYxRUDGBZu8m46B21uIq</loc>
            <lastmod>2025-10-08T16:21:21.497Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/objective-function-for-sequence-generation-policy-optimization/xZEIzue2B2r0WHooZtqS</loc>
            <lastmod>2026-06-26T20:30:27.190Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-transformer-model-is-adapted-to-compress-a-long-text-by-processing-it-sequentially-in-segments-arr/xZHPp8yvZNKVTSW1mpSJ</loc>
            <lastmod>2025-10-05T20:51:34.493Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-two-turn-dialogue-consists-of-a-users-initial-prompt-x-the-models-response-y-the-users-follow-up-p/xaFnEfZrlA3fF8DPvP3w</loc>
            <lastmod>2025-10-03T06:30:34.124Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/fine-tuning-performance-degradation/xbquqZHOrLMgGjRPjTU7</loc>
            <lastmod>2025-09-28T21:41:49.040Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-reinforcement-learning-a-penalty-is-often-used-to-limit-how-much-a-new-policy-deviates-from-a-pre/xej4jvNRyK8CsyNfHNAF</loc>
            <lastmod>2025-09-26T06:33:48.135Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/in-a-policy-optimization-algorithm-that-uses-an-importance-sampled-surrogate-objective-a-developer-o/xeoeaQpDJ6mq05FgQO4u</loc>
            <lastmod>2025-10-04T04:10:13.899Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-alignment-team-is-evaluating-a-language-models-response-using-three-distinct-reward-models-hel/xf3u4MRi2Kmc4JIArpJH</loc>
            <lastmod>2025-09-26T11:27:21.991Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-large-language-model-undergoes-two-main-training-stages-each-using-a-different-type-of-dataset-mat/xhMFld84hBUsToe4bK68</loc>
            <lastmod>2025-10-10T08:23:18.180Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reward-model-for-a-generative-text-model-calculates-a-quality-score-for-a-given-output-using-the-f/xjX0bJFLOzypiEUbV1Zh</loc>
            <lastmod>2025-10-07T08:16:00.592Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diversity-and-fluidity-of-human-values-as-an-alignment-challenge/xkjxsK93JqUErjwuyxsN</loc>
            <lastmod>2026-05-03T15:47:33.932Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/iterative-refinement-of-soft-prompts-via-transformer-layers/xlE6blLeWZWMJRnmgf8K</loc>
            <lastmod>2026-07-02T18:55:45.052Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-machine-learning-model-is-being-trained-with-the-objective-of-maximizing-a-specific-utility-functi/xlgKRuXZyWTTOIfVxe5J</loc>
            <lastmod>2025-10-04T05:30:49.093Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-to-find-the-best-route-through-a-system-it-is-presented-with-two-options-r/xlw9v4bgsTbjUXtkS8Dh</loc>
            <lastmod>2025-09-29T12:34:01.130Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/insufficiency-of-data-fitting-for-value-alignment/xm8DfMNKyRXUs4HzL83U</loc>
            <lastmod>2026-02-08T13:31:46.328Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/real-world-complexity-as-an-alignment-challenge/xmSMsrYm6lsXJm3A57TD</loc>
            <lastmod>2026-05-03T15:48:06.632Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/classification-of-llm-development-methods-by-stage-and-application-time/xp9zmKgX8LOSwBo5Hd01</loc>
            <lastmod>2026-04-30T23:33:48.347Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-sft-question-answering-task/xr8C0koKOBV5abCVDVeM</loc>
            <lastmod>2025-10-10T02:50:17.553Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-a-customer-service-chatbots-robustness/xsXj0kW0QjVKhG5zXFqg</loc>
            <lastmod>2026-02-08T14:11:51.317Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/set-of-remaining-items-in-a-ranked-sequence/xsm2odBUR8vzDIsaLXvs</loc>
            <lastmod>2026-06-27T03:12:30.238Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-problem-solving-prompt/xtf54NO9e1t9wtF0KAGG</loc>
            <lastmod>2025-10-10T02:51:08.935Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-in-an-environment-where-it-must-choose-between-two-initial-actions-from-th/xw9akiPItBlZV5MjMYJu</loc>
            <lastmod>2025-09-28T23:34:36.309Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/causality-principle-in-policy-gradient-calculation/xwFfbPqMpbwi9CH7hASN</loc>
            <lastmod>2026-05-17T18:26:49.489Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-model-adaptation-strategies-for-a-specialized-task/xz8OlODwTDLSXaVQPYd0</loc>
            <lastmod>2025-10-03T00:39:53.895Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/characterizing-ppos-learning-process/xzTLhYStAkGep4FFxGCv</loc>
            <lastmod>2025-10-10T09:18:05.777Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-key-step-in-an-alignment-algorithm-involves-re-expressing-the-preference-probability-of-a-chosen-r/y2vJHHEC97SZCMDuSsJw</loc>
            <lastmod>2025-10-07T01:06:25.951Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-post-training-alignment/y4LXu7TviHpaJiaQ7rT9</loc>
            <lastmod>2025-10-03T02:32:08.979Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-reward-structures-for-a-chatbot/y4eptqvug6QSvDPF4GRX</loc>
            <lastmod>2025-10-03T00:44:38.278Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-policy-changes/y5A4AExwWYOFbpSXbBw3</loc>
            <lastmod>2025-10-08T16:51:33.471Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-model-is-designed-to-understand-a-long-document-by-processing-it-in-three-sequential-parts-segment/y5xEETAPInSoMVK7wE7R</loc>
            <lastmod>2025-09-26T08:01:02.424Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-critics-role-as-a-baseline/y9Pdr2q3cI5yv5psDAsi</loc>
            <lastmod>2025-10-10T05:34:28.143Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/designing-a-safety-test-for-an-ai-model/yArP7AbmaMZR9n1VXvlI</loc>
            <lastmod>2025-10-10T02:12:20.780Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-applying-reinforcement-learning-to-a-language-model-the-models-policy-denoted-as-yx-is-a-separa/yBba9GcpI3wgW9mKsQte</loc>
            <lastmod>2025-10-07T15:32:06.528Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-a-missing-segment-score/yBgWJsMtRHvJRgLCBRTA</loc>
            <lastmod>2025-10-08T23:24:16.653Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/comparison-of-rlhf-and-dpo-training-pipelines/yBjunv1fZlO2VTNE3aA3</loc>
            <lastmod>2026-05-03T00:34:45.755Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/match-each-variable-from-the-formal-definition-of-intra-task-generalization-with-its-correct-descrip/yDiqEaiaUcrOW8itPC24</loc>
            <lastmod>2026-06-29T07:28:49.847Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-training-data-strategies-for-model-performance/yETLet0Xq6C8UPhU6zcv</loc>
            <lastmod>2025-10-06T12:55:56.894Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reward-models-role-in-listwise-preference-learning/yGAQMaHDoCro9oMGocu5</loc>
            <lastmod>2025-10-06T22:50:43.116Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-is-being-fine-tuned-using-a-specific-process-for-any-given-input-prompt-the-model-g/yGfmqasEDIBK99wqCUsa</loc>
            <lastmod>2025-10-06T11:16:43.720Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-creating-a-new-task-to-add-to-a-collection-used-for-fine-tuning-a-large-language-mode/yHigfb4J3CyfAk8p0e1x</loc>
            <lastmod>2025-09-26T10:19:25.090Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/traditional-nlp-alignment/yIgZQAubf3PVp37a2Us0</loc>
            <lastmod>2025-09-16T15:00:25.327Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/motivation-for-efficient-instruction-following-methods/yJNW5qbMd99tusAQmSdI</loc>
            <lastmod>2026-05-01T14:38:40.811Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/justifying-the-choice-of-a-preference-model/yJunJm8TQziExe10W4wd</loc>
            <lastmod>2025-10-06T17:42:06.537Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/empirical-formulation-of-pair-wise-ranking-loss/yJx4gM4csEYaZlvZI7Gx</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/log-probability-difference-as-a-policy-divergence-penalty/yMiDxXNzgG6n04BuuNDt</loc>
            <lastmod>2026-06-29T08:05:14.776Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-autoregressive-language-model-is-given-the-input-prompt-the-weather-today-is-and-has-so-far-gener/yPMx010ouHVWuc7eySXg</loc>
            <lastmod>2025-09-29T03:11:18.823Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/log-probability-decomposition-for-efficient-multi-turn-dialogue-training/yUeig4rV3P1snXVqDwf2</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/architecture-and-function-of-the-rlhf-value-model/yVUdZjXGdixPHXnx4t9g</loc>
            <lastmod>2026-05-02T23:17:28.257Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/process-based-reward-model-as-a-classification-task/yW7uwM7JvoUwUwVaow1D</loc>
            <lastmod>2026-05-03T15:02:49.313Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/root-cause-analysis-of-a-reward-hacking-spike-during-rlhf-with-ppo/yYt7RIsLU39v9bqHKYrg</loc>
            <lastmod>2026-02-06T16:59:46.351Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/improving-learning-for-a-maze-solving-agent/yZrhlXfpVK3lofsluK6I</loc>
            <lastmod>2025-09-28T22:02:32.386Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-actor-critic-agent-is-being-trained-to-perform-a-task-where-explicit-rewards-are-not-available-fr/ya0pSzheE9dAPiVFtQ8x</loc>
            <lastmod>2025-09-26T12:18:17.509Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/pair-wise-ranking-loss-formula-for-rlhf-reward-model/yaQRxSCDUY6MvEihJcgX</loc>
            <lastmod>2026-06-24T04:05:19.358Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-wants-to-generate-a-summary-of-a-long-business-report-that-consists-of-exactly-three-bullet-p/ybxqgfC7UpvoF9aMfx9z</loc>
            <lastmod>2025-10-05T12:25:47.273Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-model-generalization-in-customer-service/ygckrQsI5zdtn0GihDUL</loc>
            <lastmod>2026-06-29T07:28:49.847Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-research-team-is-developing-a-system-to-improve-a-language-model-using-feedback-from-a-large-diver/ygd5Cmux9lufRLJXjUbv</loc>
            <lastmod>2025-10-05T23:08:25.550Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-data-collection-for-a-real-world-ai-assistant/yiHQqbgXDBaU7bIr0Ej0</loc>
            <lastmod>2025-10-06T22:59:03.387Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/reusing-transformer-training-for-reward-models/yjt00PEU0nTxQhOLeCAu</loc>
            <lastmod>2026-05-01T18:02:14.590Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-to-see-a-doctor-symptoms-for-pregnant-women/ylaCec7QvQpK2cIcBMXQ</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/llm-alignment/ynsOceCvBaqPGJdtCYo9</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/diagnosing-a-stagnant-fine-tuning-process/yoK3FGyNjaJP4F4tYsFN</loc>
            <lastmod>2025-10-10T05:08:30.444Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/sum-of-future-rewards-notation/ypjrKmcBFtzUIJBZjmx8</loc>
            <lastmod>2026-07-03T09:03:07.362Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-automated-system-analyzes-the-following-customer-review-for-a-new-laptop-and-assigns-it-an-overal/yqkfwHh7BuOlWU9M226d</loc>
            <lastmod>2025-09-26T05:48:21.985Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/single-round-prediction-problem/yrbpnWgUgvmT0JBL0v5c</loc>
            <lastmod>2026-05-02T14:29:56.928Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-fine-tunes-a-large-pre-trained-language-model-known-for-its-strong-general-knowledge-on-a-hig/yt2jvPDT6ivLRC09j2aD</loc>
            <lastmod>2025-10-02T22:57:19.170Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-creating-a-dataset-to-fine-tune-a-pre-trained-language-model-aiming-to-imp/ywSffA52QzKCShJmpbHU</loc>
            <lastmod>2025-10-06T22:38:41.578Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-project-manager-provides-the-following-detailed-instruction-for-a-language-model-your-task-is-to-e/ywcpKAikAwlsfwQRK5cF</loc>
            <lastmod>2025-10-01T21:17:35.190Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-development-team-building-a-chatbot-aims-for-it-to-be-helpful-to-all-users-they-discover-that-beha/yxMLr8MqC6rkIcBsf1pY</loc>
            <lastmod>2026-02-08T13:31:58.927Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/role-of-the-advantage-function-in-policy-updates/yy86pB8r9pNZQ2ghupil</loc>
            <lastmod>2025-10-08T16:13:02.401Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/policy-probability-ratio-greater-than-one/yzTlpcv11FOoAl6SQxBH</loc>
            <lastmod>2026-05-01T18:26:46.868Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/using-scoring-systems-for-inference-time-rescoring/z07fSJZEyC1Ce1DMgNfd</loc>
            <lastmod>2025-10-07T11:16:51.023Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consider-a-model-that-selects-a-response-from-a-set-of-options-where-the-probability-of-selecting-an/z2u4bPQvlCJ8jZ2urk0x</loc>
            <lastmod>2025-10-08T23:54:54.479Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-bias-in-synthetic-dataset-generation/z3X0VJSalKqyxh3sRftR</loc>
            <lastmod>2025-10-05T17:00:02.114Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/rationale-for-parameter-efficient-training/z3dWoiHMh8bhZw0N9Yo2</loc>
            <lastmod>2025-10-06T01:18:37.387Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/simplifying-task-descriptions-by-deletion/z5Fo0pp1eGkG05MM9t65</loc>
            <lastmod>2026-04-30T22:46:16.794Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-and-justifying-an-rlhf-objective-under-competing-product-constraints/z602HtSuvefJCXkiaDwM</loc>
            <lastmod>2026-02-06T16:57:55.165Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-language-model-alignment-method-re-expresses-the-probability-of-a-preferred-response-ya-over-a-dis/z69vyBkh38l8Z7lliE9t</loc>
            <lastmod>2025-09-26T07:36:43.975Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-team-is-refining-a-large-language-models-conversational-abilities-their-training-process-involves-/z7itnmPJCuMKc6FBeDsX</loc>
            <lastmod>2025-10-02T05:29:32.661Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/according-to-the-standard-masked-language-modeling-mlm-training-objective-a-models-parameters-are-ad/z9jItmMzGw9FxOcjICta</loc>
            <lastmod>2026-04-29T03:52:02.307Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-being-trained-using-value-based-reward-shaping-in-a-particular-transition-from-state-st-/zAMBqoSmLtZjQrg26vBO</loc>
            <lastmod>2025-10-04T02:56:13.733Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-ai-development-team-is-choosing-between-two-methods-for-aligning-a-language-model-with-human-pref/zBZw997ohfVE70Q9dVx9</loc>
            <lastmod>2025-10-10T08:32:02.714Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/when-a-language-model-generates-a-new-token-the-state-it-uses-for-the-next-prediction-is-updated-to-/zDqV2HzGhxSepSfKKzH5</loc>
            <lastmod>2025-10-06T13:05:02.525Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/language-model-loss-as-negative-expected-utility/zFjSiZFCZ2KIy8BQb5E6</loc>
            <lastmod>2026-06-30T03:17:55.410Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-provides-the-following-request-to-a-language-model-my-laptops-fan-is-constantly-running-at-hi/zG3b6wT9tgjquslrMvOy</loc>
            <lastmod>2025-10-05T17:13:43.769Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-developer-is-prompting-a-large-language-model-to-solve-a-complex-multi-step-word-problem-initial-a/zH5bxSE3zCHnEgF0X6h7</loc>
            <lastmod>2025-10-03T02:42:59.169Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-conflicting-signals-in-rl-fine-tuning/zHlCK5l1lZgUBc3kL95j</loc>
            <lastmod>2025-10-08T16:27:42.784Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ensemble-of-multiple-small-models/zINo0Mmlb9joglPeH4Ff</loc>
            <lastmod>2026-05-01T15:43:35.937Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-alignment-problem-in-llms/zJHsC5GHayXEOCvjfptT</loc>
            <lastmod>2025-10-07T02:30:20.337Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-advantage-estimate/zJaCuOYIhJ4xJvCRBwIn</loc>
            <lastmod>2025-10-02T11:07:36.259Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-the-initial-step-in-a-generated-solution/zJgY1VChUuwGo2I1WujB</loc>
            <lastmod>2025-10-09T00:59:33.937Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/calculating-pair-wise-ranking-loss/zK70AtoYeWZzd1hEnO0B</loc>
            <lastmod>2025-10-03T20:50:26.681Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/modeling-pairwise-preference-probability-with-a-reward-function/zPNTGVbwX4BNrWRJ6zPv</loc>
            <lastmod>2026-07-08T01:07:19.375Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/example-of-a-paraphrased-task-description-for-a-healthcare-and-finance-qa-model/zPOVvWcHtqzlcIHuZvbX</loc>
            <lastmod>2026-04-30T22:47:08.995Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/crafting-a-fine-tuning-data-example/zUu2f98v5PAl96tKjnAh</loc>
            <lastmod>2025-10-10T02:32:12.886Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-reinforcement-learning-agent-is-being-trained-to-navigate-a-maze-the-original-reward-function-prov/zV7wnWzt5dNu0NVBKLrT</loc>
            <lastmod>2025-10-02T12:04:43.248Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/you-are-reviewing-an-rlhf-training-run-for-an-inte/zWEgSVGBOrQdIinctlCC</loc>
            <lastmod>2026-02-06T17:53:58.352Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-system-optimization-strategy/zWpC9OKKJXLmfRmxswLW</loc>
            <lastmod>2025-09-26T13:16:38.829Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/design-review-training-data-and-safety-controls-for-a-customer-facing-llm/zXaqPVWGsaOV1yFexrqr</loc>
            <lastmod>2026-02-06T18:24:52.667Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/adoption-of-rejection-sampling-in-llms/zZYXlDvejYzT9zgq5XKX</loc>
            <lastmod>2026-05-03T15:37:32.311Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/the-following-equations-represent-key-steps-in-deriving-the-policy-gradient-arrange-them-in-the-corr/zeu4NN3TzNLoJedvVimc</loc>
            <lastmod>2025-10-04T02:52:36.203Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/a-user-wants-to-get-a-concise-one-paragraph-overview-of-a-long-article-using-an-ai-model-which-of/zgDYhg8Lf6c971x8WVJ3</loc>
            <lastmod>2025-10-05T17:18:58.997Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/choosing-a-feedback-collection-method/zhAtOH1zBIiN9pco32Nv</loc>
            <lastmod>2025-10-02T20:08:21.066Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-data-generation-strategies/zhuccCMLiWUWzkAYcyBB</loc>
            <lastmod>2025-10-10T06:35:45.440Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/evaluating-an-ai-preference-labeler/zikeecMWn91x3uS4qjxq</loc>
            <lastmod>2025-10-04T06:44:08.976Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/debugging-a-recipe-generating-language-model/zj0vcdyGsliJsQSBeczO</loc>
            <lastmod>2025-10-08T21:32:31.500Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/ai-model-generalization-failure/zkxi0MgeqV1HhrOifkuz</loc>
            <lastmod>2025-10-03T02:19:26.750Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/an-agent-is-learning-to-play-a-game-where-the-objective-is-to-get-the-highest-possible-final-score-a/znqc8RGQwjfleE0wxoNh</loc>
            <lastmod>2025-10-06T22:47:15.604Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/arrange-the-events-in-a-cascading-inference-process-for-an-input-that-requires-escalation-to-the-mor/zoGIanq1uX6tixlbmnMF</loc>
            <lastmod>2025-10-04T16:53:14.778Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/consequences-of-static-prompt-structures-in-automated-data-generation/zu0MYrlYqWlBp7jvR6Nr</loc>
            <lastmod>2025-10-02T23:52:27.967Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/analyzing-reward-model-penalties-with-max-margin-loss/zyk3wYiaNgSexQ7JQ7da</loc>
            <lastmod>2025-10-03T02:38:01.358Z</lastmod>
            <changefreq>hourly</changefreq>
          </url>
          <url>
            <loc>https://1cademy.com/node/interpreting-the-soft-prompt-optimization-formula/zzLmM9bnYaeNEU1NwVNg</loc>
            <lastmod>2025-10-10T09:57:23.512Z</lastmod>
            <changefreq>hourly</changefreq>
          </url></urlset>