تست بنچمارک Agent خودساخته Tencent به نام WorkBuddy Bench، عملکرد CodeBuddy Code و Claude Code را مورد بررسی قرار داد. 260 سوال واقعی کاری به چهار دسته کدنویسی، وب، اداری و امنیتی تقسیم شدند و 7 مدل تحت دو مجموعه Harness مورد آزمایش قرار گرفتند. نتایج نشان داد که Claude Code در 28 گروه مقایسه مدل مشابه، 17 گروه را برد و CodeBuddy تنها 11 گروه را به دست آورد. به ویژه در سوالات کدنویسی، Claude Code با نتیجه 7:0 پیروز شد و تمامی 7 مدل پس از تغییر به Claude Code، بهبود نمره را نشان دادند. اگرچه CodeBuddy در سوالات وب و اداری با نتیجه 4:3 پیروز شد، اما در سوالات امنیتی با نتیجه 4:3 به Claude Code باخت. نتایج آزمایش نشان میدهد که تنها تغییر Harness میتواند منجر به اختلاف نمرهای چندین امتیاز شود، بنابراین ارزیابی قدرت Agentها نمیتواند تنها به مدلهای پایه وابسته باشد. با این حال، لیست Tencent نیز دارای نقاط ضعفی است، زیرا هر دسته سوال تنها 50 تا 80 سوال دارد و جامعه به این موضوع شک دارد که آیا افزایش سوالات دشوار میتواند رتبهبندی را تغییر دهد و همچنین آزمایش تنها از دو مجموعه Harness استفاده کرده و Codex را شامل نشده است.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.





























