Table of Contents

Deep Agents ਸੰਰਚਿਤ ਮਾਡਲਾਂ ਅਤੇ ਬਣੇ ਹੋਏ ਕਾਂਟੈਕਸਟ ਪ੍ਰਬੰਧਨ ਵਾਲੇ ਆਮ ਏਜੰਟ ਲਈ ਮੇਰੀ ਪਹਿਲੀ ਚੋਣ ਹੈ। Claude Agent SDK Claude Code ਦੇ ਐਗਜ਼ਿਕਿਊਸ਼ਨ ਵਿਹਾਰ ਨੂੰ ਐਪਲੀਕੇਸ਼ਨ ਵਿੱਚ ਜੋੜਨ ਲਈ ਢੁਕਵਾਂ ਹੈ। ਐਪਲੀਕੇਸ਼ਨ-ਵਿਸ਼ੇਸ਼ ਏਜੰਟਾਂ ਲਈ OpenAI Agents SDK ਅਤੇ Pydantic AI ਦੀ ਜਾਂਚ ਕਰੋ। Pi ਛੋਟੇ, ਵਧਾਏ ਜਾ ਸਕਣ ਵਾਲੇ ਕੋਰ ਨੂੰ ਤਰਜੀਹ ਦਿੰਦਾ ਹੈ, ਜਦਕਿ LangGraph ਸਪਸ਼ਟ ਵਰਕਫਲੋ ਕੰਟਰੋਲ ਦਿੰਦਾ ਹੈ।

ਸਭ ਤੋਂ ਵਧੀਆ ਚੋਣ ਉਸ ਕੰਮ ਉੱਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ ਜੋ ਤੁਸੀਂ ਸਵੀਕਾਰ ਕਰਵਾਉਣਾ ਚਾਹੁੰਦੇ ਹੋ। ਖੋਜ ਸਹਾਇਕ, ਰਿਪੋਜ਼ਟਰੀ ਐਡੀਟਰ ਅਤੇ ਗਾਹਕ ਬੇਨਤੀਆਂ ਸੰਭਾਲਣ ਵਾਲੀ ਸੇਵਾ ਲਈ ਵੱਖਰੇ ਟੂਲ ਅਤੇ ਰਿਕਵਰੀ ਨਿਯਮ ਲੋੜੀਂਦੇ ਹਨ। ਇਹ ਸਿਫਾਰਸ਼ਾਂ 10 ਅਕਤੂਬਰ 2026 ਨੂੰ ਜਾਂਚੀ ਸਰਕਾਰੀ ਦਸਤਾਵੇਜ਼ੀ ਜਾਣਕਾਰੀ ਉੱਤੇ ਆਧਾਰਿਤ ਸੰਪਾਦਕੀ ਫੈਸਲੇ ਹਨ। ਇਹ ਹੱਥੋਂ ਕੀਤੇ ਪ੍ਰਦਰਸ਼ਨ ਬੈਂਚਮਾਰਕ ਦੇ ਨਤੀਜੇ ਨਹੀਂ ਹਨ।

ਮੁੱਖ ਨੁਕਤੇ

  • ਪਹਿਲਾਂ ਅਬਸਟਰੈਕਸ਼ਨ ਚੁਣੋ: ਤਿਆਰ ਏਜੰਟ, ਐਪਲੀਕੇਸ਼ਨ SDK ਜਾਂ ਵਰਕਫਲੋ ਰਨਟਾਈਮ।
  • ਐਗਜ਼ਿਕਿਊਸ਼ਨ ਹੱਦਾਂ ਜਾਂਚੋ: ਟੂਲ ਮਨਜ਼ੂਰੀ, ਫਾਈਲ ਸਿਸਟਮ ਆਇਸੋਲੇਸ਼ਨ ਅਤੇ ਨੈੱਟਵਰਕ ਨੀਤੀ ਵੱਖਰੀਆਂ ਸਮੱਸਿਆਵਾਂ ਹੱਲ ਕਰਦੀਆਂ ਹਨ।
  • ਰਿਕਵਰੀ ਟੈਸਟ ਕਰੋ: ਸਿਰਫ ਗੱਲਬਾਤ ਦਾ ਇਤਿਹਾਸ ਦੁਹਰੀਆਂ ਬਾਹਰੀ ਕਾਰਵਾਈਆਂ ਨੂੰ ਨਹੀਂ ਰੋਕਦਾ।
  • ਸਵੀਕਾਰਿਆ ਕੰਮ ਮਾਪੋ: ਲਾਗਤ ਵਿੱਚ ਅਸਫਲਤਾਵਾਂ, ਸਮੀਖਿਆ ਸਮਾਂ ਅਤੇ ਇੰਫਰਾਸਟ੍ਰਕਚਰ ਸ਼ਾਮਲ ਕਰੋ।
  • ਮਾਡਲ ਸਪਸ਼ਟ ਰੱਖੋ: ਮਾਡਲ ਅਤੇ ਏਜੰਟ ਸਾਫਟਵੇਅਰ ਦੋਵੇਂ ਬਦਲਣ ਨਾਲ ਪੂਰਾ ਸਿਸਟਮ ਟੈਸਟ ਹੁੰਦਾ ਹੈ।

ਹਾਰਨੈੱਸ ਕੀ ਦਿੰਦਾ ਹੈ

ਏਜੰਟ ਹਾਰਨੈੱਸ ਮਾਡਲ ਕਾਲ ਦੇ ਆਲੇ ਦੁਆਲੇ ਦਾ ਸਾਫਟਵੇਅਰ ਹੈ। ਇਹ ਕਾਂਟੈਕਸਟ ਤਿਆਰ ਕਰਦਾ ਹੈ, ਟੂਲ ਦਿੰਦਾ ਹੈ, ਮਨਜ਼ੂਰ ਕਾਰਵਾਈਆਂ ਚਲਾਉਂਦਾ ਹੈ, ਨਤੀਜੇ ਵਾਪਸ ਭੇਜਦਾ ਹੈ ਅਤੇ ਤੈਅ ਕਰਦਾ ਹੈ ਕਿ ਕਦੋਂ ਜਾਰੀ ਰਹਿਣਾ ਜਾਂ ਰੁਕਣਾ ਹੈ। ਲਾਗੂ ਕਰਨ ਦੇ ਢੰਗ ਅਨੁਸਾਰ ਇਹ ਮੈਮੋਰੀ, ਡੈਲੀਗੇਸ਼ਨ, ਅਨੁਮਤੀਆਂ ਅਤੇ ਰਿਕਵਰੀ ਵੀ ਸੰਭਾਲਦਾ ਹੈ।

ਮਾਡਲ ਅਗਲੀ ਕਾਰਵਾਈ ਸੁਝਾਉਂਦਾ ਹੈ। ਟੂਲ ਕਾਰਵਾਈ ਕਰਦਾ ਹੈ। ਰਨਟਾਈਮ ਵਰਕਫਲੋ ਚਲਾਉਂਦਾ ਅਤੇ ਸੰਭਾਲਦਾ ਹੈ। ਤਿਆਰ ਉਤਪਾਦਾਂ ਵਿੱਚ ਇਹ ਜ਼ਿੰਮੇਵਾਰੀਆਂ ਮਿਲ ਸਕਦੀਆਂ ਹਨ, ਪਰ ਵੱਖ ਕਰਕੇ ਦੇਖਣ ਨਾਲ ਗੁੰਮ ਸਮਰੱਥਾਵਾਂ ਮਿਲਦੀਆਂ ਹਨ।

ਹਿੱਸਾਪੁੱਛਣ ਵਾਲਾ ਸਵਾਲ
ਕਾਂਟੈਕਸਟ ਪ੍ਰਬੰਧਨਲੰਬੀ ਰਨ ਦੌਰਾਨ ਕਿਹੜੀਆਂ ਲੋੜਾਂ ਬਚਦੀਆਂ ਹਨ?
ਟੂਲ ਐਗਜ਼ਿਕਿਊਸ਼ਨਆਰਗੂਮੈਂਟ ਕੌਣ ਜਾਂਚਦਾ ਅਤੇ ਅਧਿਕਾਰ ਕੌਣ ਸੀਮਿਤ ਕਰਦਾ ਹੈ?
ਸਟੇਟ ਸਟੋਰੇਜਪ੍ਰੋਸੈਸ ਰੀਸਟਾਰਟ ਤੋਂ ਬਾਅਦ ਕੀ ਬਚਦਾ ਹੈ?
ਤਸਦੀਕਪੂਰਾ ਹੋਣ ਦਾ ਸਬੂਤ ਕੀ ਹੈ?

ਇੱਕ ਉਦਾਹਰਨੀ ਸਹਾਇਤਾ ਏਜੰਟ ਬਾਰੇ ਸੋਚੋ ਜਿਸ ਨੂੰ ਆਰਡਰ ਜਾਂਚ ਕੇ ਬਦਲੀ ਦੀ ਬੇਨਤੀ ਤਿਆਰ ਕਰਨੀ ਹੈ। ਆਰਡਰ ਪੜ੍ਹਨਾ, ਬਦਲੀ ਸੁਝਾਉਣਾ ਅਤੇ ਬੇਨਤੀ ਭੇਜਣਾ ਵੱਖਰੇ ਅਧਿਕਾਰਾਂ ਨਾਲ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ। ਮਨਾਉਣ ਵਾਲੀ ਵਿਆਖਿਆ ਬੇਨਤੀ ਭੇਜਣ ਦੀ ਇਜਾਜ਼ਤ ਨਹੀਂ ਦਿੰਦੀ। ਸੰਭਾਲਿਆ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਵੀ ਇਹ ਨਹੀਂ ਦੱਸਦਾ ਕਿ ਬੇਨਤੀ ਪਹਿਲਾਂ ਭੇਜੀ ਗਈ ਸੀ ਜਾਂ ਨਹੀਂ।

ਦਾਇਰਾ: ਇਹ ਗਾਈਡ ਐਪਲੀਕੇਸ਼ਨ ਵਿੱਚ ਜੋੜੇ ਜਾ ਸਕਣ ਵਾਲੇ ਸਾਫਟਵੇਅਰ ਅਤੇ ਰਨਟਾਈਮ ਚੋਣਾਂ ਦੀ ਤੁਲਨਾ ਕਰਦੀ ਹੈ। ਰੋਜ਼ਾਨਾ ਡਿਵੈਲਪਰ ਇੰਟਰਫੇਸ ਲਈ ਵੱਖਰੀ CLI ਕੋਡਿੰਗ ਏਜੰਟ ਤੁਲਨਾ ਜਾਂ GUI ਕੋਡਿੰਗ ਏਜੰਟ ਤੁਲਨਾ ਵਰਤੋ। SDK ਤੁਲਨਾ ਨੂੰ ਟਰਮੀਨਲ ਟੂਲ ਅਤੇ ਐਡੀਟਰ ਐਕਸਟੈਂਸ਼ਨ ਦੀ ਰੈਂਕਿੰਗ ਨਾ ਬਣਾਓ।

ਅਮਲੀ ਛੋਟੀ ਸੂਚੀ

ਸ਼ੁਰੂਆਤੀ ਲੋੜਪਹਿਲਾਂ ਜਾਂਚਣ ਵਾਲੀ ਚੋਣਤੁਹਾਡੀ ਮੁੱਖ ਜ਼ਿੰਮੇਵਾਰੀ
ਆਮ ਏਜੰਟDeep Agentsਬੈਕਐਂਡ, ਅਨੁਮਤੀਆਂ ਅਤੇ ਮਾਡਲ ਸੰਰਚਿਤ ਕਰਨਾ
ਐਪ ਵਿੱਚ Claude CodeClaude Agent SDKਐਗਜ਼ਿਕਿਊਸ਼ਨ ਪ੍ਰੋਸੈਸ ਚਲਾਉਣਾ ਅਤੇ ਆਇਸੋਲੇਟ ਕਰਨਾ
ਐਪਲੀਕੇਸ਼ਨ ਟੂਲ ਵਰਕਫਲੋOpenAI Agents SDKਟੂਲ, ਮਨਜ਼ੂਰੀਆਂ ਅਤੇ ਸਵੀਕ੍ਰਿਤੀ ਪਰਿਭਾਸ਼ਿਤ ਕਰਨਾ
ਟਾਈਪਡ Python ਐਪਲੀਕੇਸ਼ਨPydantic AI ਅਤੇ ਇਸਦਾ Harness ਪੈਕੇਜਸਮਰੱਥਾਵਾਂ ਅਤੇ ਵਰਕਸਪੇਸ ਚੁਣਨਾ
ਛੋਟਾ ਕੋਡਿੰਗ ਕੋਰPi SDKਐਕਸਟੈਂਸ਼ਨ ਅਤੇ ਐਗਜ਼ਿਕਿਊਸ਼ਨ ਨੀਤੀ ਜੋੜਨਾ
ਸਪਸ਼ਟ ਟਿਕਾਊ ਵਰਕਫਲੋLangGraphਗ੍ਰਾਫ ਸਟੇਟ ਅਤੇ ਰਿਕਵਰੀ ਵਿਹਾਰ ਬਣਾਉਣਾ

ਇਹ ਵੱਖਰੇ ਸ਼ੁਰੂਆਤੀ ਬਿੰਦੂ ਹਨ। Deep Agents ਪਹਿਲਾਂ ਹੀ LangGraph ਵਰਤਦਾ ਹੈ, ਇਸ ਲਈ ਇਹ ਲਾਜ਼ਮੀ ਤੌਰ ਉੱਤੇ ਵਿਰੋਧੀ ਚੋਣ ਨਹੀਂ ਹੈ। Pydantic AI ਵੀ ਆਪਣੇ ਮੁੱਖ ਏਜੰਟ ਫਰੇਮਵਰਕ ਨੂੰ ਬਣੀਆਂ ਹਾਰਨੈੱਸ ਸਮਰੱਥਾਵਾਂ ਤੋਂ ਵੱਖ ਰੱਖਦਾ ਹੈ। ਤੁਹਾਨੂੰ ਆਪਣੇ ਕੋਲ ਰੱਖਣ ਵਾਲੇ ਐਪਲੀਕੇਸ਼ਨ ਕੋਡ ਦੀ ਮਾਤਰਾ ਦੀ ਤੁਲਨਾ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ।

ਸਵੀਕ੍ਰਿਤੀ ਟੈਸਟ ਪਾਸ ਕਰਨ ਵਾਲੀ ਸਭ ਤੋਂ ਛੋਟੀ ਪਰਤ ਤੋਂ ਸ਼ੁਰੂ ਕਰੋ। ਸੀਮਿਤ ਟੂਲ ਕਾਲਾਂ ਲਈ ਟਾਈਪਡ ਫਰੇਮਵਰਕ, ਖੁੱਲ੍ਹੇ ਫਾਈਲ ਜਾਂ ਖੋਜ ਕੰਮ ਲਈ ਤਿਆਰ ਏਜੰਟ ਅਤੇ ਨਾਮਿਤ ਸਟੇਟ ਵਾਲੇ ਕੰਮ ਲਈ ਸਪਸ਼ਟ ਗ੍ਰਾਫ ਵਰਤੋ। ਮੈਮੋਰੀ, shell ਜਾਂ ਸਬਏਜੰਟ ਤਦੋਂ ਜੋੜੋ ਜਦੋਂ ਟੈਸਟ ਦੱਸੇ ਕਿ ਸਧਾਰਣ ਪਰਤ ਕਿਉਂ ਅਸਫਲ ਰਹੀ।

Deep Agents: ਬਣੀਆਂ ਸਮਰੱਥਾਵਾਂ

ਫਾਈਲਾਂ, ਟੂਲਾਂ ਅਤੇ ਲੰਬੀਆਂ ਗੱਲਬਾਤਾਂ ਨਾਲ ਕੰਮ ਕਰਨ ਵਾਲੇ ਏਜੰਟ ਲਈ Deep Agents ਪਹਿਲਾਂ ਜਾਂਚੋ। ਇਸਦਾ ਸਰਕਾਰੀ ਓਵਰਵਿਊ ਫਾਈਲ ਸਿਸਟਮ ਬੈਕਐਂਡ, ਕਾਂਟੈਕਸਟ ਆਫਲੋਡਿੰਗ, ਸਮਰੀ, ਸਬਏਜੰਟ ਅਤੇ ਮਨੁੱਖੀ ਮਨਜ਼ੂਰੀ ਦੱਸਦਾ ਹੈ। ਇਹ LangChain ਅਤੇ LangGraph ਰਨਟਾਈਮ ਉੱਤੇ ਬਣਿਆ ਹੈ ਅਤੇ ਕਈ ਮਾਡਲ ਪ੍ਰੋਵਾਈਡਰਾਂ ਨਾਲ ਜੁੜਦਾ ਹੈ।

ਵਿਹਾਰ ਫਿਰ ਵੀ ਸੰਰਚਨਾ ਉੱਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ। ਮੌਜੂਦਾ ਦਸਤਾਵੇਜ਼ੀ ਜਾਣਕਾਰੀ ਮੁਤਾਬਕ ਵਰਜਨ 0.7 ਤੋਂ ਟਾਸਕ ਪਲੈਨਿੰਗ ਆਪਸ਼ਨਲ ਹੈ। ਪੁਰਾਣੇ ਵਰਜਨ ਦਾ ਟਿਊਟੋਰੀਅਲ ਮੌਜੂਦਾ ਡਿਫਾਲਟ ਨਹੀਂ ਦੱਸਦਾ। ਆਪਣੀ ਜਾਂਚ ਵਿੱਚ ਪੈਕੇਜ ਵਰਜਨ ਅਤੇ ਚਾਲੂ middleware ਦਰਜ ਕਰੋ।

ਅਨੁਮਤੀ ਦੀ ਹੱਦ ਧਿਆਨ ਨਾਲ ਜਾਂਚੋ। ਦਸਤਾਵੇਜ਼ੀ ਫਾਈਲ ਨਿਯਮ ਅੰਦਰਲੇ ਫਾਈਲ ਟੂਲਾਂ ਲਈ ਹਨ, sandbox ਬੈਕਐਂਡ ਰਾਹੀਂ ਹਰ shell ਕਮਾਂਡ ਲਈ ਨਹੀਂ। ਫਾਈਲ ਟੂਲ ਦਾ ਇਨਕਾਰ ਕਾਫ਼ੀ ਨਹੀਂ ਜੇ ਹੋਰ ਰਸਤਾ ਉਸੇ ਫਾਈਲ ਤੱਕ ਪਹੁੰਚਦਾ ਹੈ। ਬੈਕਐਂਡ ਅਤੇ shell ਹੱਦ ਇਕੱਠੇ ਟੈਸਟ ਕਰੋ।

ਮੇਰੀ ਸਿਫਾਰਸ਼: ਦਸਤਾਵੇਜ਼ ਜਾਂ ਰਿਪੋਜ਼ਟਰੀ ਵਿਸ਼ਲੇਸ਼ਣ ਸੇਵਾ ਲਈ ਇਸ ਨੂੰ ਛੋਟੀ ਸੂਚੀ ਵਿੱਚ ਰੱਖੋ ਜਦੋਂ ਬਣੀਆਂ ਸਮਰੱਥਾਵਾਂ ਅਤੇ ਪ੍ਰੋਵਾਈਡਰ ਚੋਣ ਚਾਹੀਦੀ ਹੋਵੇ। ਦੋ ਸੀਮਿਤ API ਕਾਲਾਂ ਅਤੇ ਤਸਦੀਕ ਕੀਤੇ ਜਵਾਬ ਵਾਲੇ ਕੰਮ ਲਈ ਛੋਟੀ ਚੋਣ ਨਾਲ ਸ਼ੁਰੂ ਕਰੋ। ਵੱਧ ਟੂਲ ਵੱਧ ਵਿਹਾਰ ਲਿਆਉਂਦੇ ਹਨ।

Claude: ਐਪ ਵਿੱਚ ਐਗਜ਼ਿਕਿਊਸ਼ਨ

ਜਦੋਂ ਤੁਸੀਂ Claude Code ਏਜੰਟ ਨੂੰ ਆਪਣੀ ਐਪਲੀਕੇਸ਼ਨ ਵਿੱਚ ਜੋੜਨਾ ਚਾਹੁੰਦੇ ਹੋ ਤਾਂ Claude Agent SDK ਚੁਣੋ। Anthropic ਦੀ Python ਅਤੇ TypeScript ਲਾਇਬ੍ਰੇਰੀ Claude Code ਵਰਗਾ ਐਗਜ਼ਿਕਿਊਸ਼ਨ ਲੂਪ, ਟੂਲ ਅਤੇ ਕਾਂਟੈਕਸਟ ਪ੍ਰਬੰਧਨ ਵਰਤਦੀ ਹੈ। SDK ਤੁਹਾਡੇ ਚਲਾਏ ਪ੍ਰੋਸੈਸ ਵਿੱਚ Claude Code ਬਾਈਨਰੀ ਚਲਾਉਂਦਾ ਹੈ। ਇਹ Anthropic ਦੇ ਮੁੱਢਲੇ API ਕਲਾਇੰਟ ਅਤੇ ਹੋਸਟ ਕੀਤੇ Managed Agents ਤੋਂ ਵੱਖਰਾ ਹੈ। Agent SDK ਓਵਰਵਿਊ ।

ਫਾਇਦਾ ਮੌਜੂਦਾ ਐਗਜ਼ਿਕਿਊਸ਼ਨ ਸਿਸਟਮ ਦੀ ਮੁੜ ਵਰਤੋਂ ਹੈ। ਫਾਈਲ ਕਾਰਵਾਈਆਂ, ਕਮਾਂਡਾਂ, hooks, ਅਨੁਮਤੀਆਂ, ਸੈਸ਼ਨ ਅਤੇ ਸਬਏਜੰਟ ਦਸਤਾਵੇਜ਼ੀ ਸਮਰੱਥਾਵਾਂ ਵਜੋਂ ਮਿਲਦੇ ਹਨ। ਤੁਹਾਡੀ ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਐਪਲੀਕੇਸ਼ਨ ਹੱਦ ਅਤੇ ਕੰਮ-ਵਿਸ਼ੇਸ਼ ਸਵੀਕ੍ਰਿਤੀ ਜਾਂਚ ਦਿੰਦੀ ਹੈ।

ਹੋਸਟਿੰਗ ਇੰਜੀਨੀਅਰਿੰਗ ਫੈਸਲਾ ਹੈ। Anthropic ਦੀ ਡਿਪਲੋਇਮੈਂਟ ਗਾਈਡ ਫਾਈਲ ਸਿਸਟਮ ਕੰਟਰੋਲ, ਨੈੱਟਵਰਕ ਰੋਕਾਂ ਅਤੇ ਆਇਸੋਲੇਸ਼ਨ ਦੱਸਦੀ ਹੈ। ਇਹਨਾਂ ਨੂੰ ਪ੍ਰੋਸੈਸ ਦੇ ਆਲੇ ਦੁਆਲੇ ਸੰਰਚਿਤ ਕਰੋ। ਪਰਮਿਸ਼ਨ ਪ੍ਰੌਮਪਟ ਨੂੰ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮ ਦੀ ਹੱਦ ਨਾ ਸਮਝੋ।

ਮੇਰੀ ਸਿਫਾਰਸ਼: Claude-ਅਧਾਰਿਤ ਦਸਤਾਵੇਜ਼ ਜਾਂ ਕੋਡ ਆਟੋਮੇਸ਼ਨ ਲਈ ਇਸ ਦੀ ਜਾਂਚ ਕਰੋ ਜਿੱਥੇ ਫਾਈਲ ਅਤੇ ਕਮਾਂਡ ਕੰਮ ਵੱਧ ਹੋਵੇ। ਜੇ ਲੋਕਲ ਮਾਡਲਾਂ ਅਤੇ ਕਈ ਹੋਸਟਡ ਪ੍ਰੋਵਾਈਡਰਾਂ ਦੀ ਤੁਲਨਾ ਉਤਪਾਦ ਦੀ ਮੁੱਖ ਲੋੜ ਹੈ ਤਾਂ ਪ੍ਰੋਵਾਈਡਰ-ਲਚਕੀਲਾ ਵਿਕਲਪ ਚੁਣੋ।

ਬਣੀ ਚੋਣਇੰਟੀਗ੍ਰੇਸ਼ਨ ਦਾ ਕੇਂਦਰ
Deep Agentsਮਾਡਲ ਚੋਣ, middleware ਅਤੇ ਬੈਕਐਂਡ ਸੰਰਚਨਾ
Claude Agent SDKਐਪਲੀਕੇਸ਼ਨ ਪ੍ਰੋਸੈਸ ਦੇ ਅੰਦਰ Claude Code ਐਗਜ਼ਿਕਿਊਸ਼ਨ

OpenAI: ਐਪਲੀਕੇਸ਼ਨ ਟੂਲ ਵਰਕਫਲੋ

ਫੰਕਸ਼ਨਾਂ, ਡੈਲੀਗੇਟ ਕੀਤੇ ਕੰਮਾਂ ਅਤੇ ਸਪਸ਼ਟ ਆਉਟਪੁੱਟਾਂ ਉੱਤੇ ਬਣੀ ਐਪਲੀਕੇਸ਼ਨ ਲਈ OpenAI Agents SDK ਚੁਣੋ। ਇਸਦਾ ਓਵਰਵਿਊ ਏਜੰਟ ਲੂਪ, handoffs, guardrails, tracing ਅਤੇ sandbox ਏਜੰਟ ਸਮਰੱਥਾਵਾਂ ਦੱਸਦਾ ਹੈ। SDK ਬਣਾਉਣ ਵਾਲਿਆਂ ਲਈ ਇੰਟਰਫੇਸ ਹੈ ਅਤੇ Codex ਡਿਵੈਲਪਰ ਐਪ ਤੋਂ ਵੱਖਰਾ ਹੈ।

ਮਨਜ਼ੂਰੀ ਸੰਰਚਿਤ ਕੀਤਾ ਜਾ ਸਕਣ ਵਾਲਾ ਵਿਹਾਰ ਹੈ। Human-in-the-loop ਗਾਈਡ ਫੈਸਲੇ ਤੋਂ ਬਾਅਦ ਰੁਕੀ ਰਨ ਅਤੇ ਸੀਰੀਅਲਾਈਜ਼ਡ ਸਟੇਟ ਦੱਸਦੀ ਹੈ। ਲੋਕਲ shell ਅਤੇ patch ਟੂਲਾਂ ਲਈ ਮਨਜ਼ੂਰੀ ਆਪਸ਼ਨਲ ਹੈ। ਸਿਰਫ approval callback ਜੋੜਨ ਨਾਲ ਮਨਜ਼ੂਰੀ ਲਾਜ਼ਮੀ ਨਹੀਂ ਬਣਦੀ।

ਮਾਡਲ ਸਹਾਇਤਾ OpenAI ਤੋਂ ਅੱਗੇ ਵੀ ਹੈ। ਪ੍ਰੋਵਾਈਡਰ ਦਸਤਾਵੇਜ਼ ਬਾਹਰੀ ਪ੍ਰੋਵਾਈਡਰ ਅਤੇ ਅਡੈਪਟਰਾਂ ਦੇ ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਪੁਆਇੰਟ ਦੱਸਦੇ ਹਨ। ਚੁਣੇ endpoint ਲਈ structured outputs, tool calling ਅਤੇ transport ਸਹਾਇਤਾ ਜਾਂਚੋ। ਫੀਚਰ ਸਮਾਨਤਾ ਨਾ ਮੰਨੋ।

ਮੇਰੀ ਸਿਫਾਰਸ਼: ਉਸ ਸੇਵਾ ਲਈ ਇਸ ਨੂੰ ਛੋਟੀ ਸੂਚੀ ਵਿੱਚ ਰੱਖੋ ਜਿੱਥੇ ਲਾਭਦਾਇਕ ਕਾਰਵਾਈਆਂ ਪਹਿਲਾਂ ਹੀ ਸਪਸ਼ਟ ਐਪਲੀਕੇਸ਼ਨ ਫੰਕਸ਼ਨਾਂ ਵਜੋਂ ਹਨ। ਆਰਡਰ ਲਵੋ, ਯੋਗਤਾ ਆਮ ਕੋਡ ਵਿੱਚ ਗਿਣੋ ਅਤੇ structured ਬੇਨਤੀ ਤਿਆਰ ਕਰੋ। ਮਾਡਲ ਅਗਲਾ ਟੂਲ ਚੁਣੇ ਤਾਂ ਵੀ ਅਥਾਰਾਈਜ਼ੇਸ਼ਨ ਅਤੇ ਯੋਗਤਾ ਜਾਂਚ ਐਪਲੀਕੇਸ਼ਨ ਵਿੱਚ ਰੱਖੋ।

Pydantic AI: ਟਾਈਪਡ ਐਪਲੀਕੇਸ਼ਨ

ਜਦੋਂ Python ਟਾਈਪ ਅਤੇ ਤਸਦੀਕ ਕੀਤੇ ਆਉਟਪੁੱਟ ਐਪਲੀਕੇਸ਼ਨ ਲਈ ਕੇਂਦਰੀ ਹੋਣ ਤਾਂ Pydantic AI ਚੁਣੋ। ਇਸਦੀ ਮੁੱਖ ਦਸਤਾਵੇਜ਼ੀ ਜਾਣਕਾਰੀ ਟਾਈਪਡ ਟੂਲ, dependency injection, structured outputs ਅਤੇ durable execution ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਦੱਸਦੀ ਹੈ। ਵੈਲੀਡੇਸ਼ਨ ਲੋੜੀਂਦੀ ਬਣਤਰ ਦੀ ਪੁਸ਼ਟੀ ਕਰਦੀ ਹੈ। ਇਹ ਹਰ ਖੇਤਰ ਦੀ ਸੱਚਾਈ ਦੀ ਪੁਸ਼ਟੀ ਨਹੀਂ ਕਰਦੀ।

ਵੱਖਰਾ Harness ਪੈਕੇਜ ਬਣੀਆਂ ਸਮਰੱਥਾਵਾਂ ਜੋੜਦਾ ਹੈ। ਇਸਦੀ ਦਸਤਾਵੇਜ਼ੀ ਜਾਣਕਾਰੀ Coder ਅਤੇ Researcher ਸਟੈਕ, ਫਾਈਲ ਅਤੇ shell ਪਹੁੰਚ, ਮੈਮੋਰੀ ਅਤੇ ਵਰਕਸਪੇਸ ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਦੱਸਦੀ ਹੈ। ਲੋਕਲ ਵਰਕਸਪੇਸ ਅਤੇ ਆਇਸੋਲੇਟਡ sandbox ਵੱਖਰੀਆਂ ਚੋਣਾਂ ਹਨ। ਲੋੜੀਂਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਨੂੰ ਵਰਕਸਪੇਸ ਚਾਹੀਦਾ ਹੈ।

ਮੇਰੀ ਸਿਫਾਰਸ਼: ਟਾਈਪਡ ਰਿਕਾਰਡ ਦੇਣ ਵਾਲੀ Python ਸੇਵਾ ਲਈ ਮੁੱਖ ਫਰੇਮਵਰਕ ਚੁਣੋ। ਜਦੋਂ ਵਰਕਸਪੇਸ ਖੋਜ ਜਾਂ ਖੁੱਲ੍ਹੀ ਖੋਜ ਵੀ ਚਾਹੀਦੀ ਹੋਵੇ ਤਾਂ ਹਾਰਨੈੱਸ ਸਮਰੱਥਾਵਾਂ ਜੋੜੋ। ਇਸ ਨਾਲ ਸੀਮਿਤ extraction ਸੇਵਾ ਨੂੰ ਬਿਨਾਂ ਲੋੜ shell ਪਹੁੰਚ ਨਹੀਂ ਮਿਲਦੀ।

ਇੱਕ ਉਦਾਹਰਨੀ ਇਨਵੌਇਸ ਸਮੀਖਿਆ ਏਜੰਟ ਲਈ schema validation ਜਾਂਚਦੀ ਹੈ ਕਿ ਕੁੱਲ ਰਕਮ ਗਿਣਤੀ ਹੈ ਅਤੇ ਮੁਦਰਾ ਮਨਜ਼ੂਰ ਸੂਚੀ ਵਿੱਚ ਹੈ। ਵੱਖਰਾ ਐਪਲੀਕੇਸ਼ਨ ਕੋਡ ਕੁੱਲ ਨੂੰ ਲਾਈਨ ਆਈਟਮਾਂ ਨਾਲ ਮਿਲਾਉਂਦਾ ਅਤੇ ਸਰੋਤ ਸਬੂਤ ਜਾਂਚਦਾ ਹੈ। ਦੋਵੇਂ ਟੈਸਟ ਕਰੋ।

ਐਪਲੀਕੇਸ਼ਨ ਚਿੰਤਾਸਵੀਕ੍ਰਿਤੀ ਟੈਸਟ
Structured outputਖੇਤਰ ਵੈਲੀਡੇਟ ਕਰੋ ਅਤੇ ਅਰਥ ਵੱਖਰੇ ਤੌਰ ਉੱਤੇ ਜਾਂਚੋ
ਮਨਜ਼ੂਰੀ ਰੋਕਉਡੀਕ ਰਹੀ ਕਾਰਵਾਈ ਅਤੇ ਫੈਸਲਾ ਸੰਭਾਲੋ
ਪ੍ਰੋਵਾਈਡਰ ਬਦਲਾਅਟੂਲ ਕਾਲ ਅਤੇ ਆਉਟਪੁੱਟ ਅਨੁਕੂਲਤਾ ਟੈਸਟ ਦੁਹਰਾਓ

Pi: ਛੋਟਾ ਵਧਾਏ ਯੋਗ ਕੋਰ

ਛੋਟੀ ਕੋਡਿੰਗ ਏਜੰਟ ਲਾਗੂ ਕਰਨ ਉੱਤੇ ਸਿੱਧਾ ਕੰਟਰੋਲ ਚਾਹੀਦਾ ਹੋਵੇ ਤਾਂ Pi SDK ਚੁਣੋ। ਪ੍ਰੋਜੈਕਟ ਦਸਤਾਵੇਜ਼ SDK ਅਤੇ RPC ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਨੂੰ ਇੰਟਰਐਕਟਿਵ ਇੰਟਰਫੇਸ ਨਾਲ ਦੱਸਦਾ ਹੈ। ਡਿਫਾਲਟ ਟੂਲਾਂ ਵਿੱਚ ਪੜ੍ਹਨਾ, ਲਿਖਣਾ, ਸੋਧਣਾ ਅਤੇ shell ਐਗਜ਼ਿਕਿਊਸ਼ਨ ਸ਼ਾਮਲ ਹਨ।

ਮਿਨੀਮਲਿਜ਼ਮ ਕੰਮ ਇੰਟੀਗ੍ਰੇਟਰ ਕੋਲ ਭੇਜਦਾ ਹੈ। Pi ਅੰਦਰੂਨੀ ਪਰਮਿਸ਼ਨ ਪੌਪਅੱਪ ਅਤੇ ਸਬਏਜੰਟ ਆਰਕੇਸਟ੍ਰੇਸ਼ਨ ਨਹੀਂ ਦਿੰਦਾ। ਪੁਸ਼ਟੀ ਫਲੋ ਲਈ ਦਸਤਾਵੇਜ਼ ਕੰਟੇਨਰ ਜਾਂ ਆਪਣੇ ਐਕਸਟੈਂਸ਼ਨ ਸੁਝਾਉਂਦਾ ਹੈ। ਇੱਥੇ embedded SDK ਦੀ ਜਾਂਚ ਕਰੋ, ਇਸਦੇ ਟਰਮੀਨਲ ਇੰਟਰਫੇਸ ਦੀ ਹੋਰ ਕੰਪਨੀ ਦੇ ਗ੍ਰਾਫਿਕਲ ਐਡੀਟਰ ਨਾਲ ਤੁਲਨਾ ਨਾ ਕਰੋ।

ਮੇਰੀ ਸਿਫਾਰਸ਼: ਆਪਣੀ ਕੋਡਿੰਗ ਸੇਵਾ ਲਈ Pi ਚੁਣੋ ਜਦੋਂ ਤੁਸੀਂ ਐਗਜ਼ਿਕਿਊਸ਼ਨ ਰੋਕਾਂ, ਐਕਸਟੈਂਸ਼ਨ ਸਮੀਖਿਆ ਅਤੇ ਰਿਕਵਰੀ ਨੀਤੀ ਸੰਭਾਲਣ ਲਈ ਤਿਆਰ ਹੋ। ਛੋਟਾ ਕੋਰ ਵਿਹਾਰ ਸਮਝਣ ਅਤੇ ਬਦਲਣ ਲਈ ਸੌਖਾ ਹੈ। ਤਿਆਰ ਮਨਜ਼ੂਰੀ ਅਤੇ ਆਰਕੇਸਟ੍ਰੇਸ਼ਨ ਮੁੱਖ ਲੋੜ ਹੋਵੇ ਤਾਂ ਇਹ ਘੱਟ ਢੁਕਵਾਂ ਹੈ।

LangGraph: ਸਪਸ਼ਟ ਵਰਕਫਲੋ ਕੰਟਰੋਲ

ਜਦੋਂ ਵਰਕਫਲੋ ਨੂੰ ਸਪਸ਼ਟ ਸਟੇਟ ਅਤੇ ਟ੍ਰਾਂਜ਼ੀਸ਼ਨ ਚਾਹੀਦੇ ਹੋਣ ਤਾਂ LangGraph ਚੁਣੋ। ਇਸਦੀ persistence ਦਸਤਾਵੇਜ਼ੀ ਜਾਣਕਾਰੀ thread checkpoint ਅਤੇ cross-thread store ਵਿੱਚ ਫਰਕ ਦੱਸਦੀ ਹੈ। persistent checkpointer ਪ੍ਰੋਸੈਸ ਰੀਸਟਾਰਟ ਤੋਂ ਬਾਅਦ ਰਿਕਵਰੀ ਦਿੰਦਾ ਹੈ। in-memory checkpointer ਨਹੀਂ ਦਿੰਦਾ।

LangGraph ਰਨਟਾਈਮ ਦੀ ਬੁਨਿਆਦ ਹੈ। ਤੁਸੀਂ ਵਰਕਫਲੋ ਬਣਾਉਂਦੇ ਅਤੇ ਤੈਅ ਕਰਦੇ ਹੋ ਕਿ ਮਾਡਲ-ਅਧਾਰਿਤ ਵਿਹਾਰ ਕਿੱਥੇ ਹੋਵੇ। Deep Agents ਇਹ ਬੁਨਿਆਦ ਪਹਿਲਾਂ ਹੀ ਵਰਤਦਾ ਹੈ, ਇਸ ਲਈ ਸਿੱਧੇ execution path ਕੰਟਰੋਲ ਦੀ ਲੋੜ ਹੋਣ ਤੇ LangGraph ਵਰਤੋ।

ਮੇਰੀ ਸਿਫਾਰਸ਼: ਨਾਮਿਤ ਪੜਾਵਾਂ, ਸਮੀਖਿਆ ਰੋਕਾਂ ਅਤੇ ਵੱਖਰੇ ਰਿਕਵਰੀ ਨਿਯਮਾਂ ਵਾਲੀ ਪ੍ਰਕਿਰਿਆ ਲਈ ਇਸ ਨੂੰ ਛੋਟੀ ਸੂਚੀ ਵਿੱਚ ਰੱਖੋ। ਦਸਤਾਵੇਜ਼ ਵਰਕਫਲੋ ਖੇਤਰ ਕੱਢ ਸਕਦਾ, ਤਸਦੀਕ ਕਰ ਸਕਦਾ, ਸਮੀਖਿਆ ਮੰਗ ਸਕਦਾ ਅਤੇ ਮਨਜ਼ੂਰ ਰਿਕਾਰਡ ਪਬਲਿਸ਼ ਕਰ ਸਕਦਾ ਹੈ। ਮਾਡਲ ਸਮੱਗਰੀ ਚੁਣੇ ਪਰ ਕਾਰੋਬਾਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾ ਬਣਾਏ ਤਾਂ ਸਥਿਰ ਟ੍ਰਾਂਜ਼ੀਸ਼ਨ ਲਾਭਦਾਇਕ ਹਨ।

ਵਰਕਫਲੋ ਪੜਾਅਪੂਰਾ ਹੋਣ ਦਾ ਸਬੂਤ
ਕੱਢਣਾਸਰੋਤ ਨਾਲ ਜੋੜਿਆ ਉਮੀਦਵਾਰ ਰਿਕਾਰਡ
ਤਸਦੀਕDeterministic ਜਾਂਚਾਂ ਅਤੇ ਅਪਵਾਦ
ਸਮੀਖਿਆਖਾਸ ਉਮੀਦਵਾਰ ਨਾਲ ਜੁੜਿਆ ਫੈਸਲਾ
ਪਬਲਿਸ਼ਓਪਰੇਸ਼ਨ ਨਾਲ ਦਰਜ ਬਾਹਰੀ ਰਸੀਦ

ਬਾਹਰੀ ਪ੍ਰਭਾਵਾਂ ਲਈ ਆਪਣੀ ਰਿਕਵਰੀ ਡਿਜ਼ਾਈਨ ਚਾਹੀਦੀ ਹੈ। ਗ੍ਰਾਫ ਸਟੇਟ ਸੰਭਾਲਣ ਨਾਲ ਰਿਮੋਟ ਸੇਵਾ ਲੈਣ-ਦੇਣ checkpoint ਨਾਲ atomic ਨਹੀਂ ਬਣਦਾ। ਓਪਰੇਸ਼ਨ ID ਵਰਤੋ ਅਤੇ ਦੁਬਾਰਾ ਭੇਜਣ ਤੋਂ ਪਹਿਲਾਂ ਬਾਹਰੀ ਨਤੀਜਾ ਮਿਲਾਓ।

ਗੁੰਮ ਹਿੱਸਿਆਂ ਦੀ ਜਾਂਚ ਕਰੋ

ਫੀਚਰ ਸੂਚੀ ਸਿਰਫ ਸ਼ੁਰੂਆਤ ਹੈ। ਹਰ ਚੋਣ ਨੂੰ ਆਪਣੇ ਕੰਮ ਵਰਗੀਆਂ ਅਸਫਲਤਾਵਾਂ ਵਿੱਚ ਚਲਾਓ। disposable ਵਰਕਸਪੇਸ ਅਤੇ synthetic ਰਿਕਾਰਡ ਵਾਲੀਆਂ ਟੈਸਟ ਸੇਵਾਵਾਂ ਵਰਤੋ।

ਟੈਸਟਸੰਭਾਲਣ ਵਾਲਾ ਸਬੂਤ
ਰੁਕੀ ਬੇਨਤੀਰਿਕਵਰੀ ਤੋਂ ਬਾਅਦ ਇੱਕ ਬਾਹਰੀ ਪ੍ਰਭਾਵ
ਲੰਬੀ ਗੱਲਬਾਤਮੁੱਢਲੀਆਂ ਲੋੜਾਂ ਪੂਰੀਆਂ ਰਹਿਣ
ਰੱਦ ਕਾਰਵਾਈਹੋਰ ਟੂਲ ਰਾਹੀਂ ਕੋਈ ਪ੍ਰਭਾਵ ਨਾ ਹੋਵੇ
ਅਣਭਰੋਸੇਯੋਗ ਦਸਤਾਵੇਜ਼ ਹਦਾਇਤਦਸਤਾਵੇਜ਼ ਦਾ ਟੈਕਸਟ ਅਧਿਕਾਰ ਨਾ ਲਵੇ
ਗਲਤ ਟੂਲ ਆਰਗੂਮੈਂਟਐਪਲੀਕੇਸ਼ਨ ਬਦਲਣ ਤੋਂ ਪਹਿਲਾਂ ਰੱਦ ਹੋਵੇ
ਬਜਟ ਖਤਮਜਾਂਚਣ ਯੋਗ ਅਧੂਰੇ ਕੰਮ ਨਾਲ ਸੀਮਿਤ ਰੋਕ

ਦੁਹਰਾਅ ਨੂੰ ਸਪਸ਼ਟ ਪਰਿਭਾਸ਼ਿਤ ਕਰੋ। ਬਦਲੀ ਬੇਨਤੀ ਸੇਵਾ ਵਿੱਚ ਟੈਸਟ ਸੇਵਾ ਦੇ ਬੇਨਤੀ ਸਵੀਕਾਰ ਕਰਨ ਤੋਂ ਬਾਅਦ, ਪਰ ਲੋਕਲ ਪੂਰਨਤਾ ਸੰਭਾਲਣ ਤੋਂ ਪਹਿਲਾਂ worker ਰੋਕੋ। ਰੀਸਟਾਰਟ ਉੱਤੇ ਵਰਕਫਲੋ ਨੂੰ ਓਪਰੇਸ਼ਨ ID ਲੱਭਣੀ ਚਾਹੀਦੀ ਹੈ। ਇਸ ਨੂੰ ਅੰਨ੍ਹੇ ਤੌਰ ਉੱਤੇ ਮੁੜ ਨਹੀਂ ਭੇਜਣਾ ਚਾਹੀਦਾ। ਇਹ ਪ੍ਰਸਤਾਵਿਤ ਟੈਸਟ ਹੈ, ਸੂਚੀਬੱਧ ਉਤਪਾਦਾਂ ਦਾ ਦੇਖਿਆ ਨਤੀਜਾ ਨਹੀਂ।

ਕਾਂਟੈਕਸਟ ਕੰਪੈਕਸ਼ਨ ਤੋਂ ਬਾਅਦ ਸਬੂਤ ਜਾਂਚੋ। ਮਹੱਤਵਪੂਰਨ ਲੋੜ ਕੰਮ ਦੇ ਸ਼ੁਰੂ ਵਿੱਚ ਦਿਓ, ਫਿਰ ਸੰਰਚਿਤ ਕਾਂਟੈਕਸਟ ਰਣਨੀਤੀ ਚਾਲੂ ਕਰਨ ਲਈ ਕਾਫ਼ੀ ਹਕੀਕਤੀ ਸਮੱਗਰੀ ਦਿਓ। ਏਜੰਟ ਤੋਂ ਅੰਤਿਮ artifact ਅਤੇ ਸਰੋਤ ਹਵਾਲੇ ਮੰਗੋ। ਸਾਡੀ CLM ਅਤੇ ਏਜੰਟ ਮੈਮੋਰੀ ਵਿਸ਼ਲੇਸ਼ਣ ਦੱਸਦੀ ਹੈ ਕਿ ਨੋਟ ਰੱਖਣਾ ਅਤੇ ਸਹੀ ਸਬੂਤ ਰੱਖਣਾ ਵੱਖਰੀਆਂ ਚਿੰਤਾਵਾਂ ਹਨ।

ਟੈਲੀਮੈਟਰੀ ਦੇ ਮੰਜ਼ਿਲਾਂ ਦੀ ਸਮੀਖਿਆ ਕਰੋ। ਟੂਲ ਟ੍ਰੇਸ ਅਤੇ ਮੈਮੋਰੀ ਸਟੋਰ ਵਿੱਚ ਕੰਮ ਦਾ ਡਾਟਾ ਹੋ ਸਕਦਾ ਹੈ। ਦਰਜ ਕਰੋ ਕਿ ਕਿਹੜੇ ਸਿਸਟਮ ਇਹ ਲੈਂਦੇ ਹਨ ਅਤੇ ਕਿੰਨੇ ਸਮੇਂ ਲਈ ਰੱਖਦੇ ਹਨ। ਲੋਕਲ ਮਾਡਲ inference ਦਾ ਅਰਥ ਲੋਕਲ logging, retrieval ਜਾਂ execution ਨਹੀਂ ਹੁੰਦਾ।

ਸਵੀਕਾਰੇ ਕੰਮ ਦੀ ਲਾਗਤ ਦੀ ਤੁਲਨਾ ਕਰੋ

ਦੋ ਮੁਲਾਂਕਣ ਰਸਤੇ ਵਰਤੋ। ਜਿੱਥੇ ਸਮਰਥਨ ਹੋਵੇ, controlled comparison ਵਿੱਚ ਮਾਡਲ, ਟੂਲ, task set ਅਤੇ ਬਜਟ ਇੱਕੋ ਰੱਖੋ। deployment comparison ਵਿੱਚ ਹਰ ਚੋਣ ਦੀ ਮੰਜ਼ੂਰ ਸੰਰਚਨਾ ਵਰਤੋ। ਪਹਿਲਾ ਕੁਝ ਸਾਫਟਵੇਅਰ ਪ੍ਰਭਾਵ ਵੱਖ ਕਰਦਾ ਹੈ। ਦੂਜਾ ਦੱਸਦਾ ਹੈ ਕਿ ਤੁਹਾਡੇ ਕੰਮ ਲਈ ਪੂਰਾ ਸੈੱਟਅਪ ਕਿਹੜਾ ਚੰਗਾ ਹੈ।

Controlled ਰਸਤੇ ਵਿੱਚ unsupported configuration ਨਾ ਧੱਕੋ। ਸਾਂਝਾ ਮਾਡਲ ਜਾਂ ਟੂਲ ਇੰਟਰਫੇਸ ਨਾ ਹੋਵੇ ਤਾਂ ਇਸ ਨੂੰ system evaluation ਵਜੋਂ ਰਿਪੋਰਟ ਕਰੋ। ਸੈੱਟਅਪ ਯਤਨ ਅਤੇ ਮਨੁੱਖੀ steering ਦਰਜ ਰੱਖੋ।

# Illustrative trial record, not a framework configuration file
candidate: "package and pinned version"
model: "provider and exact model identifier"
workspace: "isolated test environment"
task_set: "frozen fixtures and acceptance checks"
limits:
  elapsed_minutes: 15
  model_calls: 30
  tool_calls: 60
record:
  - accepted_result
  - unsupported_claims
  - duplicate_external_actions
  - inference_cost
  - infrastructure_cost
  - human_review_minutes
  - recovery_outcome

ਹਰ ਕੰਮ ਉੱਤੇ ਕਈ ਟ੍ਰਾਇਲ ਚਲਾਓ। ਅਸਫਲ ਕੋਸ਼ਿਸ਼ਾਂ ਨੂੰ denominator ਵਿੱਚ ਰੱਖੋ ਅਤੇ raw counts ਨਾਲ percentages ਦਿਓ। ਛੋਟਾ ਟ੍ਰਾਇਲ failure pattern ਦਿਖਾਉਂਦਾ ਹੈ, ਸਥਿਰ ਉਦਯੋਗ ਰੈਂਕਿੰਗ ਨਹੀਂ।

ਉਦਾਹਰਨੀ ਲਾਗਤ ਹਿਸਾਬ: ਮੰਨੋ setup A ਦਸ ਕੋਸ਼ਿਸ਼ਾਂ ਵਿੱਚ 12 ਡਾਲਰ ਖਰਚ ਕਰਦਾ ਅਤੇ ਅੱਠ ਸਵੀਕਾਰੇ ਨਤੀਜੇ ਦਿੰਦਾ ਹੈ। ਪ੍ਰਤੀ ਸਵੀਕਾਰਿਆ ਕੰਮ inference cost 1.50 ਡਾਲਰ ਹੈ। setup B ਅੱਠ ਡਾਲਰ ਖਰਚ ਕਰਦਾ ਪਰ ਚਾਰ ਸਵੀਕਾਰੇ ਨਤੀਜੇ ਦਿੰਦਾ ਹੈ, ਇਸ ਲਈ ਲਾਗਤ 2.00 ਡਾਲਰ ਹੈ। ਦੋਵੇਂ ਅੰਕ ਮਨੁੱਖੀ ਸਮੀਖਿਆ ਜਾਂ ਇੰਫਰਾਸਟ੍ਰਕਚਰ ਤੋਂ ਬਿਨਾਂ ਹਨ। ਇਹਨਾਂ ਨੂੰ ਵੱਖਰੇ ਕੁੱਲ ਵਿੱਚ ਦਰਜ ਕਰੋ।

ਟੈਸਟ ਤੋਂ ਪਹਿਲਾਂ disqualifying failures ਤੈਅ ਕਰੋ। ਬਿਨਾਂ ਅਨੁਮਤੀ submission ਜਾਂ user-to-user data leak ਔਸਤ quality score ਵਿੱਚ ਗਾਇਬ ਨਹੀਂ ਹੋਣਾ ਚਾਹੀਦਾ। ਇਹ ਲੋੜਾਂ ਲਾਗੂ ਕਰਨ ਤੋਂ ਬਾਅਦ correctness, recovery, review effort ਅਤੇ cost ਦੀ ਤੁਲਨਾ ਕਰੋ।

ਸੀਮਿਤ ਚੋਣ ਕਰੋ

ਦੋ ਉਮੀਦਵਾਰਾਂ ਅਤੇ ਇੱਕ ਅਸਲੀ ਵਰਕਫਲੋ ਨਾਲ ਸ਼ੁਰੂ ਕਰੋ। provider-flexible ਤਿਆਰ ਏਜੰਟ ਲਈ Deep Agents ਦੀ ਐਪਲੀਕੇਸ਼ਨ-ਅਨੁਕੂਲ ਛੋਟੀ ਚੋਣ ਨਾਲ ਤੁਲਨਾ ਕਰੋ। ਸੇਵਾ ਵਿੱਚ Claude Code ਵਿਹਾਰ ਲਈ Claude Agent SDK ਟ੍ਰਾਇਲ ਕਰੋ। ਟਾਈਪਡ ਐਪਲੀਕੇਸ਼ਨ ਲਈ Pydantic AI ਅਤੇ OpenAI Agents SDK ਦੀ ਤੁਲਨਾ ਕਰੋ। custom behavior ਵਾਧੂ ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਨੂੰ ਜਾਇਜ਼ ਬਣਾਏ ਤਾਂ Pi ਚੁਣੋ। explicit workflow control ਮੁੱਖ ਹੋਵੇ ਤਾਂ LangGraph ਚੁਣੋ।

ਟ੍ਰਾਇਲ ਦੀਆਂ ਲੋੜਾਂ: ਮਨਜ਼ੂਰ ਮਾਡਲ ਪਹੁੰਚ, synthetic fixtures, ਲੋੜ ਪੈਣ ਤੇ isolated workspace ਅਤੇ ਲਿਖੇ acceptance criteria। ਪਹਿਲੀ ਦੁਪਹਿਰ ਸੈੱਟਅਪ ਅਤੇ ਬੁਨਿਆਦੀ failure tests ਲਈ ਰੱਖੋ। ਫਿਰ production ਫੈਸਲੇ ਤੋਂ ਪਹਿਲਾਂ ਦੁਹਰਾਈਆਂ ਰਨ ਇਕੱਠੀਆਂ ਕਰੋ। ਬਾਹਰੀ ਕਾਰਵਾਈਆਂ ਅਤੇ ਰਿਕਵਰੀ ਲੋੜਾਂ ਅਨੁਸਾਰ ਮੁਸ਼ਕਲ ਦਰਮਿਆਨੀ ਤੋਂ ਉੱਚੀ ਹੈ।

ਉਹ ਸਭ ਤੋਂ ਛੋਟਾ ਸਿਸਟਮ ਚੁਣੋ ਜੋ ਲੋੜਾਂ ਪਾਸ ਕਰੇ। fixtures, package versions ਅਤੇ failure records ਸੰਭਾਲੋ। ਮਾਡਲ, ਕਾਂਟੈਕਸਟ ਰਣਨੀਤੀ, ਟੂਲ ਜਾਂ execution backend ਬਦਲਣ ਉੱਤੇ ਫਿਰ ਚਲਾਓ। ਇਹ ਬਦਲਾਅ ਮੁਲਾਂਕਣ ਕੀਤੇ ਸਿਸਟਮ ਨੂੰ ਬਦਲਦੇ ਹਨ।

ਹਵਾਲੇ