½üÄêÀ´£¬Ëæ×Å´óÄ£ÐÍ´Óµ¥Ò»ÎÊ´ð£¬×ßÏòÉî¶È×êÑÓ×¢Ò½ÁÆÕ÷ѯ¡¢¶àģ̬ÌìÉúºÍ³¤³Ì Agent ¹¤×÷£¬Ò»¸ö»ù´¡ÎÊÌâ±äµÃÔ½À´Ô½Äѻظ²£ºÎÒÃǵ½µ×Ó¦¸ÃÔõôÅжÏÄ£ÐÍÊä³öµÄÖÊÁ¿£¿
ÒÔ Deep Research »ã±¨ÆÀ¹ÀΪÀý£¬´«Í³²½Öè¿ÉÄÜÖ»ÊǶԱÈÌìÉú»ã±¨ºÍ²Î¿¼»ã±¨µÄÎı¾²î¾à£¬»òÕßÈôóÄ£Ð͸øÒ»¸ö×ÜÌå·ÖÊý¡£µ«Ò»ÆªºÃ»ã±¨²¢²»Ô¸¶¨ÒªºÍ²Î¿¼»ã±¨Ð´µÃÒ»Ñù£¬Ò²ºÜÄÑÓÃÒ»¸ö³éÏó·ÖÊý¸ÅÀ¨¡£Ëü±ØÒªÍ¬Ê±Âú×ã¶à¸öÒªÇó£¬ÀýÈçÊÇ·ñ»Ø¸²ÁËÓû§ÎÊÌâ¡¢¸²¸ÇÁ˹ؼüÐÅÏ¢¡¢ÒýÓÃÁË¿¿µÃס֤¾Ý¡¢ÂÛÖ¤ÊÇ·ñÇ峺¡¢½áÂÛÊÇ·ñÓÐЧµÈµÈ¡£
Rubrics µÄ×÷Ó㬾ÍÊǰÑÕâЩÍÌ͵ġ¸ºÃ»ã±¨¡¹³ß¶È²ð½â³ÉÃ÷È·µÄÆÀ¼ÛÏÈÃÆÀÉóÕß»ò judge model ÖðÏî²é³ºÍ´ò·Ö¡£ÕâÑù²»½öÄÜÅжϻ㱨×ÜÌåºÃ²»ºÃ£¬»¹ÄÜÖ¸³ö¾ßÌåÎÊÌ⣬²¢½øÒ»²½°ÑÕâЩϸÁ£¶È·´À¡×ª»¯ÎªÑµÁ·Ðźţ¬Ô®ÊÖÄ£ÐÍÕë¶Ô¸²¸Ç²»¼°¡¢Ö¤¾Ý²»³ä·Ö»òÂß¼²»ÇåµÈÎÊÌâ½øÐÐÓÅ»¯¡£
ÕâÒâζ×Å£¬´óÄ£Ð͵ÄѵÁ·ÓëÆÀ²âÔÚ´Óµ¥Ò»ÕýÈ·ÐÔÐźţ¬×ªÏò¶àά¶È¡¢¿ÉÚ¹Ê͵ÄÖÊÁ¿³ß¶È¡£Rubrics£¬ÔÚ³ÉΪÏνÓÈËÀà½øÕ¹¡¢¹¤×÷ÒªÇóºÍÄ£ÐÍÐÐΪµÄ³ÁÒª½Ó¿Ú¡£
½üÈÕ£¬À´×ÔÖйúÈËÃñ´óѧ¸ßê²ÈËΪÖÇÄÜѧԺµÄ×êÑÐÍŶӰ䲼×ÛÊöÂÛÎÄ¡¶The Rules of the Game: A Survey of Rubrics for Large Language Models¡·¡£ÂÛÎĹ² 40 Ò³£¬ÏµÍ³ÊáÀíÁË Rubrics ÔÚ´óÄ£ÐÍÖеĽç˵¡¢»ú¹Ø²½Ö衢ѵÁ·ÀûÓá¢ÆÀ²â³¡¾°ÓëÊ¢¿ªÌôÕ½¡£ÂÛÎÄÍ¬Ê±ÊØ»¤Á˳ÖÐø¸üÐ嵀 GitHub ÏîÄ¿£¬·½±ãÉçÇø¸ú×ÙÕâÒ»¼±¾ç·¢Õ¹µÄ·½Ïò¡£
ÔçÆÚ´óÄ£Ð͵Ť×÷ÍùÍùÓµÓÐÏà¶ÔÇ峺µÄÊäÈëÊä³ö´ó¾Ö£¬²¢ÇҴ𰸵ÄÕýÈ·ÐÔÊÇÈÝÒׯÀ¹ÀµÄ¡£ÀýÈçÎÊ´ð¹¤×÷Äܹ»±ÈÁ¦³ß¶È´ð°¸£¬´úÂ빤×÷Äܹ»ÔËÐвâÊÔÓÃÀý£¬Êýѧ¹¤×÷Äܹ»ÑéÖ¤×îÖÕÁ˾֡£¶ÔÓÚÕâЩ¹¤×÷£¬ÕýÈ·ÂÊ¡¢Ö´Ðгɹ¦ÂÊ»ò¹æ¶¨»¯¼Î½±¿ÉÄÜÌṩ½ÏÖ±½ÓµÄѵÁ·ºÍÆÀ²âÐźš£
µ«Ëæ×ÅÄ£ÐÍÄÜÁ¦À©´ó£¬¹¤×÷ÄѶÈÒ²²úÉúÁËÏÔÖø±ä¶¯¡£´óÄ£ÐÍÔÚ±»ÒªÇóʵÏÖ¸üÊ¢¿ª¡¢¸ü¸ß·çÏÕ¡¢¸ü¸´ÔӵŤ×÷¡£ÀýÈ磺×Ô¶¯ËÑË÷×ÊÁϲ¢ÌìÉú×êÑл㱨£»ÔÚÒ½ÁÆ¡¢Ë¾·¨¡¢½ðÈÚµÈרҵÁìÓò¸ø³ö·ÖÎö£»Å²ÓÃ±í²¿¹¤¾ßʵÏֶಽ¹¤×÷£»ÔÚ¶àģ̬³¡¾°ÖÐÌìÉú»òÀí½â¸´ÔÓÄÚÈÝ¡£´Ëʱ£¬Êä³öÖÊÁ¿Í¨³£²»ÔÙÓÉÒ»¸ö´ð°¸¾ö¶¨£¬¶øÊÇÓɶà¸öά¶È¹²Í¬¾ö¶¨¡£
Rubrics µÄ¼ÛÖµÔÚÕâÀïÏÔ¶³öÀ´¡£Ëü½«¡¸ºÃ´ð°¸¡¹²ð½âΪһ×éÃ÷È·µÄÆÀ¼ÛÏÀýÈçÊÂʵÕýÈ·ÐÔ¡¢¸²¸Ç¶È¡¢Ö¤¾ÝÖ§³Ö¡¢ÍÆÀíÑϽ÷ÐÔ¡¢°²È«ÐÔ¡¢ÌåʽºÏ¹æÐÔºÍÏÖʵ¿ÉÓÃÐÔ¡£ÆÀ²âÕßÄܹ»ÖðÏî´ò·Ö£¬Ò²Äܹ»½«ÕâЩ·ÖÊý¾ÛºÏΪ×îÖÕÁ˾֡£ÓëÒ»¸öºÚÏä·ÖÊýÏà±È£¬Rubrics ÌṩµÄÊǿɲ鳡¢¿Éµ÷Õû¡¢¿ÉÕï¶ÏµÄÖÊÁ¿³ß¶È¡£
ÔÚ½ÌÓýÆÀ¹ÀÖУ¬rubric ͨ³£Ö¸Ò»ÌׯÀ·ÖÖ¸ÄÏ£ºËü×¢Ã÷ÆÀ¹ÀÕßÓ¦¸Ã¿´ÄÄЩ·½Ã棬ÒÔ¼°·ÖÆçÖÊÁ¿Ë®Æ½±ðÀëÒâζ×Åʲô¡£·Åµ½ LLM ÖУ¬Rubrics Äܹ»Àí½âΪһ×éÌìȻ˵»°´ó¾ÖµÄÆÀ¼Û³ß¶È£¬Ã¿¸ö³ß¶È¶ÔÓ¦Ò»¸ö¾ßÌå¡¢¿ÉÆÀ¹ÀµÄÖÊÁ¿Î¬¶È¡£
ÕâÆª×ÛÊö¸ø³öÁËͳһ´ó¾Ö»¯£ºÒ»¸ö rubric set Äܹ»ÓÉÈô¸É rubric item ×é³É£¬Ã¿¸ö item Ô̺¬ÌìȻ˵»°ÃèÊö£¨¾ßÌåµÄ rubrics ʾÀýÄܹ»°Ý¼ûͼ 1 ϰ벿ÃÅ£©ºÍ³ÁÒªÐÔȨ³Á£»¶ÔÓÚÊäÈ빤×÷ºÍÄ£ÐÍÊä³ö£¬ judge model ÖðÏî¸ø³ö·ÖÊý£¬ÔÙͨ¹ý¾ùÔÈ¡¢¼ÓȨÇóºÍ»òÒþʽ¾ÛºÏµÃµ½ÕûÌåÆÀ¼Û¡£
¸ü³ÁÒªµÄÊÇ£¬ÂÛÎÄ¶Ô Rubrics Ó뼸¸öÈÝÒ×»ìºÏµÄ¸ÅÏë½øÐÐÁË·Ö±æºÍ»áÉÌ¡£LLM-as-a-Judge ½â¾öµÄÊÇ¡¸ËÀ´ÆÀ¡¹£¬Rubrics ½â¾öµÄÊÇ¡¸°´Ê²Ã´³ß¶ÈÆÀ¡¹£»reward model ͨ³£Ö±½ÓÊä³öÒ»¸ö±êÁ¿·ÖÊý£¬¶ø Rubrics ½«ÆÀ¼Û³ß¶ÈÏÔʽÁгö£»RLVR ÒÀÀµ×Ô¶¯¿ÉÑéÖ¤µÄ´ð°¸£¬¶ø Rubrics ¸üÊʺÏÄÇЩ±ØÒª¶àά¶ÈÅжϡ¢ÄÑÒÔÆëÈ«ÑéÖ¤µÄÊ¢¿ªÊ½¹¤×÷¡£
Rubrics ÊÇ·ñÓÐЧ£¬Ê×ÏÈÈ¡¾öÓÚËüÃÇ×ÔÉíÊÇ·ñ×ã¹»ºÃ¡£Ò»¸ö¹ýÓÚ¿í·ºµÄ³ß¶È£¬ÀýÈç ¡°»Ø¸²¸Ãµ±ÓÐÔ®ÊÖ¡±£¬ºÜÄÑÌṩ²»±äµÄѵÁ·ºÍÆÀ²âÐźţ»Ò»¸ö¹ýÓÚϸËé»ò³Á¸´µÄ³ß¶È£¬ÓÖ¿ÉÄÜ´øÀ´ÈßÓàÆÀ·ÖºÍÔëÉù¡£
µÚ¶þÀàÊǶԱÈÌìÉú¡£Ïà±ÈÖ»¿´Ò»¸ö´ð°¸£¬¶Ô±ÈÌìÉú»áÊäÈëÆ«ºÃ¶Ô£¬ÀýÈçÒ»¸ö¸ßÖÊÁ¿»Ø¸²ºÍÒ»¸öµÍÖÊÁ¿»Ø¸²£¬ÈÃÄ£ÐÍ×ܽá¶þÕß²î¾à£¬´Ó¶øÌáÈ¡¸üÓÐÅжÏÁ¦µÄ³ß¶È¡£
µÚÈýÀàÊǵü´úÓÅ»¯¡£×êÑÐÕ߯ðÍ·²»ÔÙ°Ñ Rubrics »ú¹Øµ±³ÉÒ»´ÎÌìÉú¹¤×÷£¬¶øÊÇÒýÈëµü´úµØÑéÖ¤¡¢·Ö»¯¡¢¹ýÂ˵ÈÁ÷³Ì¡£ÀýÈç¼ì²âij¸ö³ß¶ÈÊÇ·ñÄܲ»±äÇø·Ô쫺öԣ¬µÝ¹é²ð·Ö¹ý´ÖµÄ³ß¶È£¬×îÖյõ½¸üÔ×Ó¡¢¸ü½ô´ÕµÄ rubric set¡£
µÚËÄÀàÊÇÔÚÏßÓ빲ͬÑÝ»¯¡£¶ÔÓÚÇ¿»¯½ø½¨ºÍ Agent ¹¤×÷À´Ëµ£¬¾²Ì¬ Rubrics ¿ÉÄܺܿì¹ýÆÚ¡£Òò¶ø£¬²¿Ãʤ×÷³¢ÊÔÈà Rubrics Ëæ×Å policy rollouts ¸üУ¬½«Ð³öÏÖµÄÃýÎóÐÐΪÄÉÈëÆÀ¼Û³ß¶È£¬Ê¹ Rubrics ÓëÄ£ÐÍѵÁ·¹ý³Ì¹²Í¬ÑÝ»¯¡£
ÔÚÄ£ÐÍѵÁ·ÖУ¬Rubrics µÄÖ÷Ìâ×÷ÓÃÊǰѸ´ÔÓÖÊÁ¿ÒªÇóת»¯Îª¿ÉÓÅ»¯µÄ¼à¶½Ðźš£Ïà±ÈÒ»¸öÕûÌ寫ºÃ±êÇ©£¬Rubrics ÄÜ֪ͨģÐÍ¡¸ÄÄÀï×öµÃºÃ¡¢ÄÄÀï±ØÒª¸Ä¡¹£¬Òò¶ø³ö¸ñÊʺÏÊ¢¿ªÊ½¹¤×÷ºÍ¶à²½ Agent ¹¤×÷¡£
³ß¶ÈµÄ»ùÓÚ rubrics ×ö policy RL µÄ·½Ê½ÊÇ£º¸ø¶¨ÊäÈëºÍÄ£ÐÍÌìÉúµÄ»Ø¸²£¬judge model °´ Rubrics ÖðÏî´ò·Ö£¬ÔÙ½«·ÖÊý¾ÛºÏΪһ¸ö¼Î½±£¬ÓÃÓÚ PPO¡¢GRPO µÈÇ¿»¯½ø½¨Ëã·¨¡£Õâ¸ö¹ý³ÌÄܹ»×÷ÓÃÔÚ×îÖÕ´ð°¸ÉÏ£¬Ò²Äܹ»×÷ÓÃÔÚÆëÈ«¹ì¼£ÉÏ¡£¶ÔÓÚ¹¤¾ßŲÓà Agent¡¢Éî¶È×êÑÐ Agent »ò¶àÄ£Ì¬ÍÆÀíÄ£ÐÍ£¬¹ì¼£¼¶ Rubrics ÓÈÆä³ÁÒª£¬ÓÉÓںöàÃýÎó²¢²»»áÖ±½ÓÌå´Ë¿Ì×îÖÕ´ð°¸ÖС£Ê¾ÀýͼÈçÏ£º
²»Í⣬½«¶àά Rubrics µ¥Ò»¼ÓȨΪһ¸ö±êÁ¿¼Î½±ÊDZÈÁ¦´ÖÁ£¶ÈÇÒ²»½Ã½ÝµÄ£¬ÓÉÓÚ·ÖÆç³ß¶ÈÖ®¼ä¿ÉÄÜ´æÔÚÒÀÀµ¡¢Ã¬¶Ü»òÓ²Ô¼Êø¹ØÏµ¡£ÀýÈçÒ½ÁÆÎÊ´ðÖеݲȫÐÔ²»Ó¦Ö»ÊÇÒ»¸öͨ³£¼Ó·ÖÏ¶ø¿ÉÄÜÊÇ veto ǰÌᣨһµ©Î¥·´Ôò reward Ϊ 0£©¡£»ùÓÚ´Ë£¬ºÜ¶à¹¤×÷½øÒ»²½Ìá³öÉè¼Æ¸üÏȽø¸ü³°ôµÄ rubric reward£ºÔ̺¬¿É½ø½¨µÄ Rubric Ȩ³Á¡¢ÒýÈë veto »ò saturation »úÔì¡¢½áºÏ»·¾³·´À¡¡¢°´ÄѶȽøÐÐ curriculum ѵÁ·£¬ÒÔ¼°ÔÚ RL Ëã·¨ÄÚ²¿½áºÏ rubrics Éè¼ÆÓÅÊÆ¹À¼Æ¡£
»¹ÓÐÒ»À๤×÷½« Rubrics ´Ó¡¸¹ýºó´ò·Ö¹¤¾ß¡¹Íƶ¯Îª¡¸ÌìÉú¹ý³ÌÖеÄÁìµ¼¡¹¡£Ä£ÐÍÄܹ»ÏÈÌìÉú»ò¶ÁÈ¡ Rubrics£¬Ôپݴ˹滮»Ø¸²£»Ò²Äܹ»°ÑδÂú×ãµÄ Rubric ת»¯Îª·´À¡£¬Áìµ¼ÏÂÒ»ÂÖ¸Äд¡£ÕâÒâζ×Å Rubrics ²»½öÄÜ֪ͨģÐÍÒ»¸öÊä³öµÃ¼¸¶à·Ö£¬»¹ÄÜÔ®ÊÖÄ£ÐÍË÷Çó¸ü¸ßÖÊÁ¿µÄÊä³ö¿Õ¼ä¡£
Rubrics Ò²±»Ô½À´Ô½¶àµØÓÃÓÚ reward model training¡£´«Í³ reward model ÍùÍùÖ»Êä³öÒ»¸ö±êÁ¿·ÖÊý£¬ÄÑÒÔÚ¹ÊÍΪʲôij¸ö»Ø¸²¸üºÃ¡£ÒýÈë Rubrics ºó£¬reward model Äܹ»±»ÑµÁ·ÎªÏÈÆ¾¾Ý³ß¶È½øÐзÖÎö£¬ÔÙ¸ø³öÆ«ºÃÅжϣ»Ò²Äܹ»Êä³ö¶à¸öά¶ÈµÄ·ÖÊý£¬²¢Í¨¹ýÏÔʽ¾ÛºÏµÃµ½×îÖÕ reward¡£Æ¾¾Ý×ÛÊöµÄÕû¶Ù£¬Rubrics ÔÚ reward model training ÖÐÖØÒª²ûÑïÈýÀà×÷Óá£
´«Í³ reward model ͨ³£Ö±½ÓÊä³öÒ»¸ö±êÁ¿·ÖÊý£¬ÆÀ¼Û³ß¶ÈÒþº¬ÔÚÄ£ÐͲÎÊýÖУ¬×êÑÐÕߺÜÄÑÅжÏÄ£Ð͵½µ×ƾ¾Ýʲô×ö³öÆ«ºÃÅжϡ£ÒýÈë Rubrics ºó£¬¼Î½±Ä£ÐÍÄܹ»±»ÑµÁ·ÎªÏÈÝÓÈÆ¸ø¶¨³ß¶È½øÐÐÖðÏî·ÖÎö£¬ÔÙÊä³ö×îÖÕÆ«ºÃÅжϣ»Ò²Äܹ»¶Ô·ÖÆç rubric ά¶È±ðÀë´ò·Ö£¬ÔÙͨ¹ýÏÔʽ¾ÛºÏµÃµ½×îÖÕ reward¡£ÕâÑùÒ»À´£¬¼Î½±Ä£ÐͲ»ÔÙÖ»ÊÇÒ»¸öºÚÏä´ò·Ôì÷£¬¶øÊÇ¿ÉÄÜչʾ¡¸ÎªÊ²Ã´Õâ¸ö»Ø¸²¸üºÃ¡¹¡¸ÄÄЩά¶Å×°ÏìÁË×îÖÕ·ÖÊý¡¹¡£
³ýÁË×îÖÕÆ«ºÃÊÇ·ñÕýÈ·Ö®±í£¬Rubrics »¹Äܹ»×÷Ϊ½á¹¹»¯²Î¿¼µ¥Ôª£¬ÓÃÀ´Ô¼Êø¼Î½±Ä£Ð͵ÄÖÐÑë·ÖÎö¹ý³Ì¡£ÀýÈ磬һЩ¹¤×÷»á½«ÈËΪ±ê×¢»òÀÏʦģÐÍÌìÉúµÄÀíÓɲð½âΪ rubric-level µÄ²Î¿¼Ðźţ¬²¢ÔÚѵÁ·Öм¤Àø reward model µÄ·ÖÎö¹ý³ÌÓëÕâЩ³ß¶Èά³ÖÒ»Ö£»Ò²Óв½ÖèÒªÇóÄ£ÐÍÏÈÌìÉú Rubrics£¬ÔÙ½øÐзÖÎöºÍÅжϣ¬²¢Í¨¹ý¶î±íµÄ proxy model ÆÀ¹ÀÌìÉú Rubrics µÄÖÊÁ¿£¬´Ó¶ø°Ñ Rubrics ×ÔÉíÒ²ÄÉÈëÓÅ»¯Ö¸±ê¡£
´«Í³Æ«ºÃÊý¾ÝÖÐÍùÍùÔ̺¬³¤¶È¡¢Ìåʽ¡¢ÓïÆøµÈdz²ãÏßË÷£¬reward model ¿ÉÄÜѧ»áÕâЩ±í±íÌØµã£¬¶ø²»Êǽø½¨ÕæÕý¾ö¶¨»Ø¸²ÖÊÁ¿µÄ³É·Ö¡£Rubrics Äܹ»Ô®ÊÖ¼ø±ðÓ°Ïì»Ø¸²ÖÊÁ¿µÄÖ÷Ìâά¶È£¬²¢¾Ý´Ë»ú¹Ø¸üÓÐÕë¶ÔÐÔµÄѵÁ·Ñù±¾£¬Ê¹¼Î½±Ä£Ð͸ü¹Ø×¢ÊÂʵÐÔ¡¢ÆëÈ«ÐÔ¡¢°²È«ÐÔ¡¢ÍÆÀíÖÊÁ¿µÈÄÚÈݳ߶ȣ¬¶ø²»ÊÇÒÀÀµ¡¸»Ø¸²¸ü³¤¡¹¡¸Ìåʽ¸üÕûÆë¡¹ÕâÖÖ¡£
³ýÁËѵÁ·£¬Rubrics ÁíÒ»¸ö³£¼ûµÄÓô¦ÊÇÄ£ÐÍÆÀ²â¡£¶ÔÓÚÊ¢¿ªÊ½¹¤×÷£¬Rubrics Ï൱ÓÚÒ»·ÝÏÔʽµÄÆÀ¼Û³ß¶È£ºËü½ç˵Á˱ØÒª²é³µÄά¶È£¬ÈôºÎ¸ø·ÖµÈµÈ¡£±¾ÎÄÒÀÕÕͨÓù¤×÷ºÍÁìÓòÌØ¶¨µÄ¹¤×÷¶ÔÒÑÓеĻùÓÚ rubrics ÆÀ¹ÀµÄ benchmark ½øÐÐÁË·ÖÀࣺ
ÔÚͨÓù¤×÷ÖУ¬Rubrics Òѱ»ÓÃÓÚÍÆÀíÄÜÁ¦¡¢Éî¶È×êÑÓעʢ¿ªÊ½ÌìÉú¡¢Í¨Óà Agent ÄÜÁ¦ºÍ¶ÔÆëÆÀ²â¡£ÀýÈçÔÚÊýÑ§ÍÆÀí¹¤×÷ÖУ¬ÆÀ²â²»ÔÙÖ»¿´×îÖմ𰸣¬»¹»á²é³ÖÐÑë²½ÖèµÄÕýÈ·ÐÔ£»Éî¶È×êÑй¤×÷µÄÆÀ²â»áͬʱ¹Ø×¢ÐÅÏ¢¸²¸Ç¡¢Ö¤¾ÝÖ§³ÖµÈά¶È£»Agent ¹¤×÷ÓÐ¹ØµÄÆÀ²âÔò½øÒ»²½¹Ø×¢¹¤¾ßÑ¡Ôñ¡¢²ÎÊýŲÓᢺͶàÂÖÖ´Ðп¿µÃסÐԵȷ½Ãæ¡£
ÔÚרҵÁìÓòÖУ¬Rubrics µÄ¼ÛÖµ¸üÏÔÖø¡£ÀýÈ磬ÔÚÒ½ÁÆÎÊ´ðÁìÓò£¬ÈËÃDZØÒª×¨¼ÒÔì¶©³ß¶ÈÀ´²é³Ä£Ðͻظ²ÖеÄҽѧÕýÈ·ÐÔ¡¢°²È«·çÏպ͹µÍ¨ÖÊÁ¿µÈµÈ£»ÔÚ˾·¨ºÍ½ðÈÚ¹¤×÷ÖУ¬ÎÒÃDZØÒªÆÀ¹ÀÊÂʵºÏÓᢹý³Ì¿ÉÉ󼯡¢·çÏÕÅû¶ºÍʵÎñ¿É²Ù×÷ÐÔ£»ÔÚÕⲿÃÅ£¬×ÛÊöÒÀÕÕÆÀ¹ÀµÄ¶ÔÏó£¨ÖÐÑë¹ì¼£ºÍ×îÖմ𰸣©ºÍ³ß¶È£¨ÊÂʵÐÔ¡¢°²È«ÐÔ¡¢×¨Òµ±í°×ºÍÏÖʵ¿ÉÓÃÐÔ£©¶ÔÒÑÓеŤ×÷½øÐÐÁ˾ßÌåµÄ·ÖÀàºÍ»áÉÌ¡£
Ê×ÏÈÊÇ reward hacking¡£Ä£ÐÍÔÚѵÁ·¹ý³ÌÖпÉÄÜѧ»á hack rubrics µÄ±í±íÌØµã£¬¶ø²»ÊÇÕæÕýÌáÉý¹¤×÷ÖÊÁ¿¡£ÈôºÎÉè¼Æ¸üÎÈÖØµÄ Rubrics¡¢²¢ÈÃÉè¼Æ Rubrics ËæÑµÁ·¹ý³ÌµÄ¸üлúÔ죬ÊÇδÀ´³ÁÒª·½Ïò¡£
Æä´ÎÊÇ rubric-based reward model µÄ·º»¯¡£ºÃ¶à Rubrics À´×ÔÌØ¶¨¹¤×÷»òÁìÓò£¬reward model ¿ÉÄܹýÄâºÏÕâЩ³ß¶È¶øÃÔʧ·º»¯ÐÔ¡£Î´À´±ØÒª×êÑÐÈôºÎÈüν±Ä£ÐÍÔÚй¤×÷¡¢ÐÂÁìÓòÏÂÒÀÈ»ÓÐЧµØ»ùÓÚ Rubrics ½øÐÐ reward ÍÆË㣬ÓÈÆäÊÇÔÚÒ½ÁÆ¡¢Ë¾·¨¡¢½ðÈںͿÆÑ§ÍÆÀíµÈ¸ßÃż÷ÁìÓò¡£
µÚÈýÊÇÆÀ²âÎó²î¡£Rubrics Äܹ»Ìá¸ßÆÀ²âµÄ¿ÉÚ¹ÊÍÐÔ£¬µ«²¢²»ÄÜ×Ô¶¯½â³ý bias¡£Rubric µÄд·¨£¬judge model µÄ°ÎÈ¡µÈµÈ³ÇÊжÔ×îÖյįÀ²â²úÉú bias¡£ÈôºÎÉè¼Æ¸ü³°ô¸ü²»±äµÄ Rubric-based evaluation ÊÇÒ»¸ö±ØÒª½â¾öµÄÎÊÌâ¡£
´Ë±í£¬¸öÐÔ»¯ Rubrics ºÍ Rubric °²È«Ò²ÔÚ³ÉΪÐÂÎÊÌâ¡£¸öÐÔ»¯ Rubrics Äܹ»¸üºÃµØ¿Ì»Óû§Æ«ºÃ£¬µ«Ò²¿ÉÄܹý¶Å׺Ïdz²ãÆ«ºÃ£¬ÉõÖÁÓ밲ȫ³ß¶Èì¶Ü¡£Óë´Ëͬʱ£¬Rubrics ×ÔÉíÒ²¿ÉÄܳÉΪ¹¥»÷Ãæ£º¶ñÒâ»òÒñ±ÎµÄ³ß¶È¸Äд¿ÉÄÜ͵͵Ťת judge µÄÆ«ºÃ·½Ïò£¬²¢½øÒ»²½Ó°ÏìѵÁ·Êý¾ÝºÍÄ£ÐÍÐÐΪ¡£
ÕâÆª×ÛÊöµÄÖ÷ÌâÒâ˼£¬²»Ö»ÊÇÁоÙÁË Rubrics Óйع¤×÷£¬¶øÊǰÑÒ»¸öÔÚ¼±¾çÀ©ÕŵÄ×êÑз½Ïò·Å½øÁËͳһ¿ò¼ÜÖУºRubrics ÊÇ´óÄ£ÐÍѵÁ·ÓëÆÀ²âÖеÄÏÔʽÖÊÁ¿½Ó¿Ú¡£Ëü½ç˵³ß¶È£¬×éÖ¯·´À¡£¬ÏνÓÈËÀàÆ«ºÃ¡¢¹¤×÷Ô¼ÊøÓëÄ£ÐÍÓÅ»¯¡£
Ëæ×Å´óÄ£ÐͳÖÐø×ßÏòÊ¢¿ªÊ½¡¢¸ß·çÏÕºÍ Agentic ÀûÓã¬ÏµÍ³±ØÒªµÄ²»Ö»ÊǸüÇ¿µÄÌìÉúÄÜÁ¦£¬»¹±ØÒª¸üÃ÷ÏÔµÄÖÊÁ¿½ç˵¡£Rubrics µÄ¼ÛÖµÔÚÓÚ´Ë£ºËüÈḺô𰸡¹²»ÔÙÖ»ÊÇÒ»¸öÍÌÍÂÖ±¾õ£¬¶ø³ÉΪһ×éÄܹ»»áÉÌ¡¢²é³¡¢Åú¸ÄºÍÓÅ»¯µÄÃ÷È·³ß¶È¡£
电影《轮番上阵》完整版科技巨头也嗅到了风向。2026 年 5 月,谷歌在 Android Show: I/O Edition 2026 上发布了 Gboard 内置的 Gemini 驱动 AI 语音听写功能 Rambler。该功能能够自动去除口头禅、理解用户的中途修改,并支持多语言混合输入,被视为谷歌正式进入 AI 语音听写赛道的重要一步。谷歌 Android 核心体验总监 Ben Greenwood 将其描述为「重新发明键盘」。据巴西《环球体育》报道,当地时间本周六,巴西队在对阵埃及的热身赛中出现伤情。效力于罗马的右后卫韦斯利-利马在上半场感到左腿不适,随后被达尼洛换下。离场后,韦斯利情绪低落,在替补席上落泪。电影《轮番上阵》完整版¡¶jrsÖ±²¥(ÎÞ²å¼þ)Ö±²¥nba178¡·坐落佛罗里达州迈阿密加登斯,距离迈阿密市区约27公里,2016年斥资 6.5亿美元大规模翻新,配备巨型半开放式遮阳顶棚,场地天然百慕大草皮,世界杯无需更换草皮;历史承办6届超级碗决赛、2024美洲杯决赛、F1迈阿密大奖赛配套场地,美东老牌多功能地标球场;迈阿密湿热多雨气候,顶棚可遮蔽绝大多数看台,场地露天利于草坪透气。日本队于5月25日正式完成集结,在国内完成第一阶段备战后,于6月2日抵达墨西哥蒙特雷。该地同时也是日本队世界杯小组赛第二场对阵突尼斯的比赛城市。蒙特雷海拔约540米,相较于海拔高达2240米的墨西哥城而言,并不会对球员的心肺功能造成额外高原负担,但真正的挑战并不在“高”,而在“热”。
20260608 ? 电影《轮番上阵》完整版“我们仍然无法确定尤文图斯将在转会市场上有何动作。我认为存在严重问题,缺乏组织结构和所有者,也就是一个值得信赖的领导者,就像过去的阿涅利和博尼佩尔蒂那样,他们能够果断决策并付诸行动,无需过多人手。”这是马尔科·塔尔德利在被问及“老妇人”尤文图斯赛季失利时所说的话。尤文图斯再次被要求重新规划未来,带着对过去转会操作的遗憾和悔恨回到转会市场,在斑马军团球迷眼中,这带来的更多是担忧而非期待。这位前尤文图斯中场球员首先阐明了管理层的责任,他认为这也适用于意大利足坛的另一支令人担忧的球队:AC米兰。¡¶¡¶×óȯ֮ÎÇ¡·¶¯Âþ¡·值得注意的是,《星期日卫报》在报道中提到,特斯拉当前的工厂利用率约为60%,这也限制了其工厂的扩张。种种因素令特斯拉在印度建设生产工厂的计划迟迟未能推进,仅有零售业务仍在开展。《财富》杂志印度版引述分析人士的话形象地描述了特斯拉目前在印度的处境:对特斯拉而言,印度似乎只是被打上了一个勾——即“是的,我们已经进入该市场了”。
20260608 ? 电影《轮番上阵》完整版各地持续向县乡调剂增加编制,借调县乡工作人员基本实现应清尽清。与此同时,全国在岗驻村第一书记19.2万名、工作队员33万名,一支支驻村工作队为实现乡村全面振兴贡献力量。GOGOGO¸ßÇåÃâ·ÑÅÔ¹ÛµçÊÓ¾çÒ»°Ù¶È在这样的背景下,24岁的若弗雷需要保持稳定的出场时间,而在这家加泰罗尼亚俱乐部他可能无法获得这样的机会,因此不排除他在今年夏窗离队寻求新机会的可能性,尤其是在蒙奇表示将进行多笔出售以便后续引援之后。